[控场AI]
概念VLM / Vision Language Model

视觉语言模型

能够同时处理视觉(图像/视频)和语言(文本)输入的多模态AI模型,通过视觉编码器将图像转化为视觉token后与语言模型联合建模,支持视觉问答、图像描述等任务

时间轴 (近 90 天)

9月13日

BI Visual Advisor 本质上是一个基于图像理解的多模态 AI 应用,依赖视觉语言模型(VLM)能力

待验证50%
9月11日

研究者提出了一个简单、无需训练的框架,让具备推理能力的视觉语言模型进行迭代搜索、动态推理和证据积累

待验证50%

全部知识事实 (2)

来源文章