主要内容

本页采用了机器翻译。点击此处可查看英文原文。

对图像和视频进行分类

使用 AI 模型对图像和视频进行分类并执行活动识别

Computer Vision Toolbox™ 提供使用深度学习和传统计算机视觉技术对图像和视频进行分类的端到端工作流。对于图像类别分类,您可以使用基于深度学习的预训练视觉变换器 (ViT) 和 CLIP 模型,或对自定义数据集应用视觉词袋方法。这些工作流支持场景识别、内容过滤和自动标记等应用。首先使用图像标注器视频标注器标注场景级类别,然后使用标注数据训练或微调模型。

对于视频分类和活动识别,工具箱支持您将帧序列分类为行走、游泳或做饭等动作类别。这些功能对于人机交互和监控等任务至关重要。工具箱支持训练、评估和部署能够解释视频数据中的时序模式以识别复杂活动的模型。

类别

  • 图像类别分类
    使用视觉特征袋、CNN、视觉变换器和视觉语言模型对图像进行分类
  • 视频分类
    使用深度学习对视频进行分类并执行活动识别

精选示例