PaLM-E是由Google研发的多模态大型语言模型,将视觉感知与语言理解能力相结合,能够处理图像和文本的联合输入。该模型以PaLM为语言基础,融合视觉编码器,主要面向具身智能(Embodied AI)场景,支持机器人任务规划、视觉问答及场景理解等应用,是将大型语言模型能力扩展至物理世界交互领域的代表性研究成果之一。
VLM(视觉语言模型)通常由视觉编码器(如ViT)、语言模型和连接两者的投影层组成,代表性模型包括GPT-4V/4o、Claude 3.5、LLaVA系列和InternVL