主要内容

本页采用了机器翻译。点击此处可查看英文原文。

YOLO v3 入门指南

“只需看一次” (YOLO) v3 目标检测器是一个多尺度目标检测网络,它利用特征提取网络和多个检测头,在多个尺度上进行预测。

YOLO v3 目标检测模型会对输入图像运行深度学习卷积神经网络 (CNN),从而基于多个特征图生成网络预测结果。目标检测器收集并解码预测结果,从而生成边界框。

预测图像中的目标

YOLO v3 使用锚框来检测图像中的目标类别。更多详情请参阅Anchor Boxes for Object Detection。YOLO v3 会针对每个锚框预测以下三个属性:

  • 交并比 (IoU) - 预测每个锚框的对象性得分。

  • 锚框偏移量 - 调整锚框的位置

  • 类别概率 - 预测分配给每个锚框的类别标签。

图中显示了特征图中每个位置的预定义锚框(虚线),以及应用偏移量后的优化位置。与某个类匹配的框以彩色显示。

设计一个 YOLO v3 检测网络

要设计一个 YOLO v3 目标检测网络,请按照以下步骤操作。

  1. 从特征提取网络开始构建模型。特征提取网络是构建 YOLO v3 深度学习网络的基础网络。基础网络可以是预训练网络或未训练的卷积神经网络 (CNN)。如果基础网络是一个预训练网络,则可以进行迁移学习。

  2. 使用卷积层、批量归一化层和 ReLU 层创建检测子网络。将检测子网添加到基础网络中的任意一层。作为检测子网络输入的输出层,即为检测网络的源。特征提取网络中的任何一层均可作为检测网络的输入源。若要利用多尺度特征进行目标检测,请选择不同大小的特征图。

要手动创建一个 YOLO v3 深度学习网络,请使用深度网络设计器 (Deep Learning Toolbox)。若要通过编程方式创建一个 YOLO v3 深度学习网络,请使用 yolov3ObjectDetector 对象。

迁移学习

要进行迁移学习,可以使用一个预训练网络作为 YOLO v3 深度学习网络的基础网络。通过指定锚框和新的目标类别,配置 YOLO v3 深度学习模型,以便在新的数据集上进行训练。使用 yolov3ObjectDetector 对象,可以基于任何预训练网络(如 SqueezeNet)创建 YOLO v3 检测网络,并进行迁移学习。有关预训练卷积神经网络 (CNN) 的列表,请参阅预训练的深度神经网络 (Deep Learning Toolbox)

训练一个目标检测器,并使用 YOLO v3 模型检测目标

要在标注数据集上训练 YOLO v3 目标检测网络,请使用 trainYOLOv3ObjectDetector 函数。您必须指定用于训练网络的数据集的类名和预定义的锚框。

该训练函数将训练好的神经网络作为 yolov3ObjectDetector 对象返回。然后,您可以使用 detect 函数,结合已训练好的 YOLO v4 目标检测器,检测测试图像中的未知对象。要了解如何以深度学习网络为基础网络来创建自定义的 YOLO v3 目标检测器,并对其进行目标检测训练,请参阅Object Detection Using YOLO v3 Deep Learning示例。

为深度学习标注训练数据

您可以使用图像标注器视频标注器真实值标注器 (Automated Driving Toolbox)以交互方式对像素进行标注,并导出标注数据用于训练。这些 App 还可用于为目标检测标注矩形感兴趣区域 (ROI)、为图像分类标注场景标签,以及为语义分割标注像素。若要根据任何标注员导出的真实值对象创建训练数据,可以使用 objectDetectorTrainingDatapixelLabelTrainingData 函数。有关详细信息,请参阅Training Data for Object Detection and Semantic Segmentation

参考

[1] Redmon, Joseph, and Ali Farhadi. “YOLO9000: Better, Faster, Stronger.” In 2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 6517–25. Honolulu, HI: IEEE, 2017. https://doi.org/10.1109/CVPR.2017.690.

[2] Redmon, Joseph, Santosh Divvala, Ross Girshick, and Ali Farhadi. "You only look once: Unified, real-time object detection." Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 779–788. Las Vegas, NV: CVPR, 2016.

另请参阅

App

对象

函数

主题