待验证50% 置信事实精确时间
模型引入通义千问自研的吸收式Attention机制QSA,与DeepSeek的DSA(DeepSeek Sparse Attention)思路高度相似
1
来源数
50%
置信度
长期有效
时效性
2026/9/6
首次发现
来源
涉及实体
相关事实
待验证DeepSeek 8B采用了GQA(Grouped Query Attention)注意力机制以降低推理时的显存占用78% 相似已验证DeepSeek V4采用自研的分层压缩注意力策略,设计了CSA(压缩吸收注意力)和HCA(重度压缩注意力)两种注意力模式交替使用77% 相似待验证DeepSeek-V3.2-Exp首次引入自研的DeepSeek Sparse Attention(DSA)稀疏注意力技术75% 相似已验证DeepSeek采用了混合专家架构(MoE)和多头潜在注意力机制(MLA)73% 相似待验证经验回放最早在DeepMind的DQN算法中被提出,智能体将过去的交互经验存储在缓冲区中,训练时随机采样以提高样本利用效率72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/863815API
curl https://kongchang.com/api/v1/knowledge/claims/863815MCP
get_claim(id=863815)