待验证50% 置信事实精确时间
Google的RT-2使用预训练的视觉-语言模型(如PaLI)作为backbone联合编码图像观察和自然语言指令,并在输出端生成离散化的动作token
1
来源数
50%
置信度
长期有效
时效性
2026/9/8
首次发现
来源
涉及实体
相关事实
待验证RT-2首次证明了VLA架构的可行性,通过将机器人动作离散化为token,让视觉语言模型直接输出动作序列73% 相似待验证谷歌的PaLI、OpenAI的GPT-4V、Meta的LLaMA Vision均沿用了类似的图文对齐预训练策略72% 相似待验证Meta的ImageBind和Google的PaLM-E模型证明,将视觉、语言、惯性数据联合编码可提升机器人对复杂场景的理解能力67% 相似待验证通用实验室(Tongying Lab)发布了视觉-语言-动作(Vision-Language-Action)模型67% 相似已验证VLA将预训练的视觉-语言模型与机器人动作策略直接对接,使机器人能够将自然语言指令、摄像头图像与低级运动控制统一处理67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/880242API
curl https://kongchang.com/api/v1/knowledge/claims/880242MCP
get_claim(id=880242)