主要内容

本页采用了机器翻译。点击此处可查看英文原文。

视觉语言模型

使用视觉语言模型执行图像分类、检索、描述和目标检测任务

视觉语言模型 (VLM) 是一种多模态模型,它接受图像和文本输入,可以生成文本输出或返回带有相应注解的边界框,从而实现目标检测和视觉定位等任务。这些模型可以分析图像或视频中的视觉内容、处理随附的文本,并识别视觉数据和文本数据之间的关联。它们支持一系列涉及在语言上下文中解释视觉信息的任务,使用的是预测算法而非真正的理解。Computer Vision Toolbox™ 提供了多个预训练 VLM,包括 CLIP、Grounding DINO 和 Moondream,适用于以下应用:

  • 图像描述 - 为图像生成描述性文本。

  • 图像检索 - 从预定义集合中找到与文本描述最匹配的图像。

  • 目标检测 - 根据基于文本的查询检测图像中的目标。

  • 图像分类 - 根据文本类别对图像进行分类。

此外,您可以使用 VLM 在图像标注器视频标注器中使用描述性文本提示词自动标注真实值。要开始使用,请参阅Get Started with Vision-Language Models

Vision-language models enable you to rapidly detect objects in images using natural language text and image input, and perform other vision-language tasks such as image captioning, classification, and retrieval.

App

图像标注器为计算机视觉应用标注图像
视频标注器Label video for computer vision applications

函数

全部展开

clipNetworkCreate pretrained CLIP deep learning neural network for vision-language tasks (自 R2026a 起)
classifyClassify image using CLIP network (自 R2026a 起)
extractImageEmbeddingsExtract feature embeddings from image using CLIP network image encoder (自 R2026a 起)
extractTextEmbeddingsExtract text embeddings from search text using CLIP network text encoder (自 R2026a 起)
moondreamCreate pretrained Moondream vision-language model (VLM) (自 R2026a 起)
captionImageCaption images using Moondream vision-language model (VLM) (自 R2026a 起)
groundingDinoObjectDetectorDetect and localize objects using Grounding DINO object detector (自 R2026a 起)
detectDetect objects using Grounding DINO object detector (自 R2026a 起)

主题

快速入门

精选示例