模型
Jamba
AI21 Labs推出的混合架构大语言模型,将Transformer注意力层与Mamba SSM层交替堆叠,并引入MoE(混合专家)结构,兼顾长上下文能力与推理效率
时间轴 (近 90 天)
9月12日
已有Mamba-2及与Transformer混合的架构(如Jamba)问世,将注意力机制与SSM层交替叠加
待验证50%
AI21 Labs推出的混合架构大语言模型,将Transformer注意力层与Mamba SSM层交替堆叠,并引入MoE(混合专家)结构,兼顾长上下文能力与推理效率
已有Mamba-2及与Transformer混合的架构(如Jamba)问世,将注意力机制与SSM层交替叠加