概念VLM / Vision Language Model
视觉语言模型
能够同时处理视觉(图像/视频)和语言(文本)输入的多模态AI模型,通过视觉编码器将图像转化为视觉token后与语言模型联合建模,支持视觉问答、图像描述等任务
时间轴 (近 90 天)
9月13日
BI Visual Advisor 本质上是一个基于图像理解的多模态 AI 应用,依赖视觉语言模型(VLM)能力
待验证50%
9月11日
研究者提出了一个简单、无需训练的框架,让具备推理能力的视觉语言模型进行迭代搜索、动态推理和证据积累
待验证50%