已验证65% 置信事实精确时间
斯坦福大学曾发布研究报告,记录了GPT-4在特定任务上跨时间段的性能波动
3
来源数
65%
置信度
长期有效
时效性
2026/7/13
首次发现
来源
Codex入门指南:与Claude Code的全面对比及选型建议
bilibiliai大模型-教程2026/7/8
相关事实
待验证斯坦福大学2023年的研究发现GPT-4在某些任务上的表现在数月内出现了可测量的下降85% 相似待验证斯坦福大学2024年的AgentBench基准测试显示,GPT-4级别模型在需要跨系统协调的复杂任务中端到端成功率低于30%79% 相似待验证斯坦福大学2023年的研究表明,GPT-4在开放域问答任务上的准确率比传统NLU系统高出约40个百分点79% 相似待验证OpenAI的API端点名称不变时底层模型权重可能被静默更新,2023年Stanford和UC Berkeley联合研究发现GPT-4在不同时期对相同prompt的表现存在显著差异,某些任务准确率从97%骤降到2%77% 相似已验证斯坦福大学2023年Chen等人的研究证实GPT-4在数月内的数学推理能力存在显著波动76% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/501087API
curl https://kongchang.com/api/v1/knowledge/claims/501087MCP
get_claim(id=501087)