当前位置:   article > 正文

使用yolov8训练数据集及使用中遇到的问题_yolov8训练失败

yolov8训练失败

1.下载yolov8文件夹

下载链接

就是这个文件夹,别怕

 2.yolov8模型

下载链接,我下了yolov8s.py,放在该路径E:\nfshare\yolov8\ultralytics\weights

ps:model文件类型可以是yaml,也可以是pt

 3.修改yolov8.yaml文件

E:\nfshare\yolov8\ultralytics\cfg\models\v8\yolov8.yaml,就改类别数

nc: 9  # number of classes

4.新建data文件

 E:\nfshare\yolov8\ultralytics\cfg\datasets\hr.yaml,这些和yolov5一样

5.修改default.yaml文件

E:\nfshare\yolov8\ultralytics\cfg\default.yaml ,就动了以下几个参数

  1. model: weights/yolov8s.pt # (str, optional) path to model file, i.e. yolov8n.pt, yolov8n.yaml
  2. data: cfg/datasets/hr.yaml # (str, optional) path to data file, i.e. coco128.yaml
  3. epochs: 1 # (int) number of epochs to train for
  4. amp: False
  5. batch: 8

 运行代码 yolo cfg=cfg/default.yaml

6.训练yolov8模型(train)

1.新建.py文件训练模型

在路径下新建python脚本文件\yolov8\ultralytics\demo.py,就像运行yolov5的模型一样,运行该脚本文件。

下面这些参数要怎么设置我还没懂。

  1. #import sys
  2. #sys.path.append("/home/yyt/nfshare/yolov8/")
  3. from ultralytics import YOLO
  4. # Create a new YOLO model from scratch
  5. #model = YOLO('/home/yyt/nfshare/yolov8/ultralytics/cfg/models/v8/yolov8.yaml')
  6. # Load a pretrained YOLO model (recommended for training)
  7. model = YOLO('/home/yyt/nfshare/yolov8/ultralytics/weights/yolov8s.pt')
  8. # Train the model using the 'coco128.yaml' dataset for 3 epochs
  9. results = model.train(data='/home/yyt/nfshare/yolov8/ultralytics/cfg/datasets/hr.yaml',amp=False,epochs=2,batch=8,val=True)
  10. # Evaluate the model's performance on the validation set
  11. #results = model.val(data='/home/yyt/nfshare/yolov8/ultralytics/cfg/datasets/hr.yaml',amp=False,epochs=2,batch=8)
  12. success = model.export(format='onnx')

2.运行default.yaml文件训练模型

直接输入yolo cfg=/文件的路径/default.yaml

3.命令运行直接输:

yolo task=detect mode=train model=/yolov8/ultralytics/cfg/runs/detect/train6//weights/last.pt(模型位置,模型可以是.yaml形式或者.pt) data=/yolov8/ultralytics/cfg/datasets/hr.yaml(数据集.yaml文件位置) epochs=150 save=True resume=True (后面的都是参数,具体写什么看default.yaml里面你需要改什么)

7.测试训练后的模型(test)

1.运行default.yaml

修改default.yaml,运行代码和train一样

修改mode: val,model:/runs/detect/train6/weights/last.pt ,split: test 

2.代码运行

这个方法能显示test每张图片检测的结果

yolo predict model= '/home/yyt/nfshare/yolov8/ultralytics/cfg/runs/detect/train6/weights/last.pt'(模型路径) source= '/home/yyt/nfshare/zijianshujuji/image/test'(图片文件路径)

问题

1.box_loss   cls_loss   dfl_loss全显示为nan,map全为0

显卡问题,batch值太大

解决:在default.yaml中,改小batch值 ,amp改为False

2.val的box_loss、cls_loss、dfl_loss为0,train不为0

排查问题:

1.validator.py文件

为了解决问题1 result全显示为0,我删去了validator中的如下代码,恢复看看能不能跑通val

 self.args.half = self.device.type != 'cpu'  # force FP16 val during training

 失败

2.amp

amp改为ture,好的这个不能改,改了又都是nan

不是我瞎改的问题

尝试:

1.在trainer.py里面搜索half关键字,把所有有.half()变为.float()
  1. #'model': deepcopy(de_parallel(self.model)).half(),
  2. 'model': deepcopy(de_parallel(self.model)).float(),
  3. #'ema': deepcopy(self.ema.ema).half(),
  4. 'ema': deepcopy(self.ema.ema).float(),

 无效果

2.继续修改val.py,修改batch['img'].half()改为batch['img'].float()
  1. #batch['img'] = (batch['img'].half() if self.args.half else batch['img'].float()) / 255
  2. batch['img'] = (batch['img'].float()) / 255

 3.继续修改validator.py

 不行

4.改小batch_size

batch_size=4

不行

解决:更新环境和其他安装包,pip install  -r requirement.txt

3.运行default.yaml,报错 ModuleNotFoundError: No module named 'ultralytics'

  1. (yolov5) root@xxdell:/home/yyt/nfshare/yolov8/ultralytics# yolo cfg=/home/yyt/nfshare/yolov8/ultralytics/cfg/default.yaml
  2. Traceback (most recent call last):
  3. File "/home/nephilim/environment/anaconda3/envs/yolov5/bin/yolo", line 5, in <module>
  4. from ultralytics.cfg import entrypoint
  5. ModuleNotFoundError: No module named 'ultralytics'

解决方法:在/home/xx/environment/anaconda3/envs/yolov5/bin/yolo文件中添加路径

sys.path.append("/home/yyt/nfshare/yolov8/")

 再次运行,解决

4.训练结果runs文件保存路径改变

原本的训练结果保存在/home/yyt/nfshare/yolov8/runs 里面,即我的共享文件夹和yolov8存在的项目文件了,现在被更改了也不知道是怎么回事,前两次训练结果就没有出现。现在的文件夹路径在虚拟机的环境路径里/home/xx/environment/anaconda3/envs/yolov5/bin/runs/detect

感觉使用的不是yolov8,而是yolov5

  1. (base) yyt@dell:/home/xx/environment/anaconda3/envs/yolov5/bin/runs/detect$ stat train
  2.   File: train
  3.   Size: 4096          Blocks: 8          IO Block: 4096   directory
  4. Device: 824h/2084d    Inode: 16883842    Links: 3
  5. Access: (0755/drwxr-xr-x)  Uid: (    0/    root)   Gid: (    0/    root)
  6. Access: 2023-08-21 15:02:27.587039861 +0800
  7. Modify: 2023-08-21 14:59:15.937472731 +0800
  8. Change: 2023-08-21 14:59:15.937472731 +0800

分析:

这几次运行的都是配置default.yaml,运行python文件,正常显示。


5.断网导致训练中断,继续训练

参考http://t.csdn.cn/UZRqy

命令行直接输入代码如下,模型改为之前跑的last.pt,epochs是总的训练次数

yolo task=detect mode=train model=/home/yyt/nfshare/yolov8/ultralytics/cfg/runs/detect/train6//weights/last.pt data=/home/yyt/nfshare/yolov8/ultralytics/cfg/datasets/hr.yaml epochs=150 save=True resume=True

6.ValueError: cannot convert float NaN to integer

训练完模型后,继续跑val测试,出现以下错误。

  1. Validating runs/detect/train/weights/best.pt...
  2. Ultralytics YOLOv8.0.173
    声明:本文内容由网友自发贡献,不代表【wpsshop博客】立场,版权归原作者所有,本站不承担相应法律责任。如您发现有侵权的内容,请联系我们。转载请注明出处:https://www.wpsshop.cn/w/Monodyee/article/detail/710582
    推荐阅读
    相关标签