待验证50% 置信事实精确时间
GQA由Google在2023年提出,将多个查询头共享同一组Key-Value头,已被LLaMA 3、Mistral等主流模型采用
1
来源数
50%
置信度
长期有效
时效性
2026/7/6
首次发现
来源
26M超轻量模型Needle:本地微调工具调用全流程实战
bilibili薛定猫AI2026/7/3
相关事实
待验证GQA由Google在2023年提出,将多个查询头共享同一组Key-Value头,可降低KV Cache内存消耗50%-75%82% 相似待验证GQA(分组查询注意力)是标准多头注意力的高效变体,由Google在2023年提出,已被LLaMA 3、Mistral等主流模型采用81% 相似待验证Google发布了Gemma 4系列开源模型,包含四款不同参数规模的模型71% 相似待验证GQA最早由Google在训练PaLM 2时提出并应用,随后被Llama 2/3、Mistral等开源模型采纳69% 相似已验证思维链(Chain-of-Thought)提示技术由Google Research于2022年提出69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/112995API
curl https://kongchang.com/api/v1/knowledge/claims/112995MCP
get_claim(id=112995)