待验证60% 置信事实精确时间
具身智能当前主流技术路线是视觉-语言-动作模型(VLA),将摄像头图像与语言指令共同输入,直接输出机械臂的关节控制信号
2
来源数
60%
置信度
长期有效
时效性
2026/7/11
首次发现
来源
AI Agent入门:概念、架构与核心组成全解析
bilibili李宏毅-机器学习2026/7/10
相关事实
已验证VLA将预训练的视觉-语言模型与机器人动作策略直接对接,使机器人能够将自然语言指令、摄像头图像与低级运动控制统一处理80% 相似待验证虚拟手写功能通过智能眼镜内置的摄像头和传感器实时捕捉手部动作,将空中手势轨迹识别并转化为文字输入74% 相似待验证通应实验室推出了Coin VLA视觉语言动作模型,专注于通用具身智能72% 相似待验证当前主流 VLM 经过大规模 UI 截图数据训练,能够识别界面元素的层级关系,将视觉布局映射为功能语义71% 相似待验证Matic采用视觉(vSLAM)导航方案,利用摄像头阵列感知环境,配合深度学习模型识别障碍,技术路线与特斯拉自动驾驶的纯视觉理念相近69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/487361API
curl https://kongchang.com/api/v1/knowledge/claims/487361MCP
get_claim(id=487361)