待验证50% 置信基准精确时间
加州大学伯克利分校发布的 Gorilla 基准测试表明,当候选工具超过 20 个时,即便是 GPT-4 级别的模型,工具选择准确率也会下降 15%-30%
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/6
首次发现
有效期至:2026/12/5
来源
涉及实体
相关事实
待验证GPT-4V、Gemini 等大模型在工业缺陷检测、病理切片分析等垂直领域的零样本检测精度在 mAP 指标上与专用模型存在 20-40 个百分点的差距68% 相似待验证在工具数量超过20个的场景下,工具描述的语义歧义度与模型选择准确率之间存在显著的负相关关系67% 相似待验证一项针对GPT-4的研究显示,对MMLU题目进行语义等价改写后,模型准确率在部分子集上下降超过10个百分点65% 相似已验证When available tools exceed 15-20, mainstream LLMs show a noticeable decline in tool selection accuracy.65% 相似待验证2023年的多项Benchmark测试(如HaHackathon数据集)显示,顶级LLM在讽刺识别任务上的准确率仍显著低于普通人类标注者64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/865049API
curl https://kongchang.com/api/v1/knowledge/claims/865049MCP
get_claim(id=865049)