待验证50% 置信基准精确时间
在 LaMP-2 数据集上,基于 BM25 的检索方法准确率为 0.760–0.765,与 PersonaLink 在统计上无法区分
1
来源数
50%
置信度
长期有效
时效性
2026/9/11
首次发现
来源
涉及实体
相关事实
待验证2023年的多项Benchmark测试(如HaHackathon数据集)显示,顶级LLM在讽刺识别任务上的准确率仍显著低于普通人类标注者61% 相似待验证模板匹配的置信度阈值通常取0.8~0.95来判断是否找到目标61% 相似待验证移除歧义后所有模型准确率提升26.8至40.2个百分点,Gemini甚至达到81%,表明歧义是深度搜索代理最大性能瓶颈之一59% 相似待验证指标数量与数据可信度存在错觉权衡:标称20+项指标的低价秤不比8项的可靠,重点看电极数和App算法品牌而非指标条数59% 相似待验证加州大学伯克利分校发布的 Gorilla 基准测试表明,当候选工具超过 20 个时,即便是 GPT-4 级别的模型,工具选择准确率也会下降 15%-30%59% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/897558API
curl https://kongchang.com/api/v1/knowledge/claims/897558MCP
get_claim(id=897558)