已验证65% 置信事实精确时间
GQA(分组查询注意力)是标准多头注意力的高效变体,由Google在2023年提出,已被LLaMA 3、Mistral等主流模型采用
3
来源数
65%
置信度
长期有效
时效性
2026/7/6
首次发现
来源
26M超轻量模型Needle:本地微调工具调用全流程实战
bilibili薛定猫AI2026/7/3
相关事实
待验证GQA由Google在2023年提出,将多个查询头共享同一组Key-Value头,已被LLaMA 3、Mistral等主流模型采用81% 相似待验证GQA最早由Google在训练PaLM 2时提出并应用,随后被Llama 2/3、Mistral等开源模型采纳69% 相似待验证GQA由Google在2023年提出,将多个查询头共享同一组Key-Value头,可降低KV Cache内存消耗50%-75%67% 相似待验证Meta的LLaMA、Google的Gemma等主流开源模型均大量采用量化和知识蒸馏技术62% 相似已验证自注意力机制由Google在2017年的论文《Attention Is All You Need》中提出61% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/114485API
curl https://kongchang.com/api/v1/knowledge/claims/114485MCP
get_claim(id=114485)