视觉语言模型
使用视觉语言模型执行图像分类、检索、描述和目标检测任务
视觉语言模型 (VLM) 是一种多模态模型,它接受图像和文本输入,可以生成文本输出或返回带有相应注解的边界框,从而实现目标检测和视觉定位等任务。这些模型可以分析图像或视频中的视觉内容、处理随附的文本,并识别视觉数据和文本数据之间的关联。它们支持一系列涉及在语言上下文中解释视觉信息的任务,使用的是预测算法而非真正的理解。Computer Vision Toolbox™ 提供了多个预训练 VLM,包括 CLIP、Grounding DINO 和 Moondream,适用于以下应用:
图像描述 - 为图像生成描述性文本。
图像检索 - 从预定义集合中找到与文本描述最匹配的图像。
目标检测 - 根据基于文本的查询检测图像中的目标。
图像分类 - 根据文本类别对图像进行分类。
此外,您可以使用 VLM 在图像标注器和视频标注器中使用描述性文本提示词自动标注真实值。要开始使用,请参阅Get Started with Vision-Language Models。

函数
主题
快速入门
- Get Started with Vision-Language Models
Use vision-language models for multimodal tasks such as image captioning, zero-shot classification, and image search.



