待验证50% 置信事实精确时间
Hymba是NVIDIA于2024年提出的混合头注意力架构,在同一层内同时部署SSM头和注意力头,通过可学习门控机制融合输出,在1.5B参数规模下超越同规模纯Transformer和纯SSM模型
1
来源数
50%
置信度
长期有效
时效性
2026/8/29
首次发现
来源
涉及实体
相关事实
待验证Nemotron-H 是 NVIDIA 于 2025 年发布的混合架构系列模型,将 Mamba 状态空间模型层与标准 Transformer 注意力层交替堆叠68% 相似待验证MiMo V2.5 Pro支持100万token的超长上下文窗口,并采用混合注意力机制66% 相似待验证DeepSeek-V4 Flash采用混合注意力、mHC混合机制以及哈希路由的MoE等架构设计64% 相似待验证Megatron-LM最早系统化提出了针对Transformer的张量并行方案,将注意力头和FFN层分别切分到不同设备64% 相似待验证LLaMA-2 70B采用80层、64个注意力头的架构,并使用GQA(8个KV头共享64个Q头)63% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/816411API
curl https://kongchang.com/api/v1/knowledge/claims/816411MCP
get_claim(id=816411)