待验证50% 置信基准精确时间
表现最佳的Edu-QuRater在还原留出集的GPT-4.1-mini成对判断时平均准确率达到0.917
1
来源数
50%
置信度
长期有效
时效性
2026/9/11
首次发现
来源
涉及实体
相关事实
待验证该研究发现GPT-4在判断素数任务上的准确率从2023年3月的97.6%骤降至6月的2.4%74% 相似待验证在GPT-4发布初期,主流模型在GPQA上的准确率约为35-40%,人类领域专家基准线约为65%,随机猜测为25%74% 相似待验证GPTQ(2022年)和AWQ(2023年)能将70B参数的LLM量化到INT4精度,困惑度损失不到1%70% 相似待验证4Bit量化下模型的基准测试得分通常能保持原始精度的90%-95%70% 相似待验证在Artificial Analysis的Omniscience幻觉指标上,GPT-5.6 Sol Max高达89%,高于Claude Fable的55%和GLM 5.2的28%69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/893229API
curl https://kongchang.com/api/v1/knowledge/claims/893229MCP
get_claim(id=893229)