主要内容

本页采用了机器翻译。点击此处可查看英文原文。

检测和分割目标

使用 AI 模型检测目标、识别文本 (OCR)、检测条形码和基准标记,执行语义分割和实例分割

Computer Vision Toolbox™ 支持使用 AI 模型进行目标检测、文本检测 (OCR) 和分割的端到端工作流。您可以首先使用图像标注器视频标注器对图像和视频进行交互式和 AI 辅助标注来创建真实值数据。对于目标检测,Computer Vision Toolbox 提供了预训练深度学习模型,如 YOLO、RTMDet、SSD 和 Grounding DINO,您可以直接使用或通过迁移学习进行微调以适应您的应用。您还可以使用目标检测器分析器评估目标检测性能度量。有关目标检测的详细信息,请参阅使用深度学习入门目标检测

对于语义分割,您可以使用预训练深度学习模型,如 U-Net、DeepLab v3+、BiseNet v2 和 3-D U-Net 来执行像素级分类。有关语义分割的详细信息,请参阅Get Started with Semantic Segmentation Using Deep Learning。对于实例分割,您可以使用预训练深度学习模型,如 SOLOv2 和 Mask R-CNN。有关实例分割的详细信息,请参阅Get Started with Instance Segmentation Using Deep Learning

对于文本检测,您可以使用 MSER 特征检测器或 CRAFT 深度学习模型,然后使用 OCR 识别检测到的文本。有关详细信息,请参阅Getting Started with OCR。Computer Vision Toolbox 还提供预训练的 HRNet 关键点检测器,用于人体位姿估计,您也可以将其微调以用于其他目标的自定义关键点检测。有关详细信息,请参阅Getting Started with HRNet

类别

  • 目标检测
    使用 YOLO 和 Grounding DINO 等预训练 AI 模型标注真实值和检测目标,使用迁移学习创建自定义检测器
  • 语义分割
    使用预训练 AI 模型标注真实值并执行语义分割,使用迁移学习训练 U-Net 等自定义网络
  • 实例分割
    使用 SOLOv2、Mask R-CNN 和 SAM 等预训练 AI 模型标注真实值并执行实例分割,或使用迁移学习训练自定义模型
  • 文本、条形码和基准标记检测与识别
    使用 AI 模型检测和识别文本 (OCR)、条形码和基准标记
  • 关键点检测
    使用预训练 HRNet 关键点检测器估计图像中的人体位姿或训练自定义目标关键点检测器
  • 自动化视觉检查
    使用异常检测和定位方法自动执行质量控制任务

精选示例