模型
GPT-5
OpenAI发布的GPT-5大语言模型,在KingBench评测中与Qwen 3.8 Max表现相当
时间轴 (近 90 天)
6月3日
Chandler AI的Agent功能集成了GPT-5、Claude 4系列、Gemini 2.5 Pro等多款大语言模型,支持用户灵活切换
待验证60%
6月3日
GPT 5.1在Atlas浏览器自动化任务中1分05秒内完成
待验证70%
6月3日
GPT 5.1号称在简单任务上比GPT 5快2倍,复杂任务深度提升2倍,幻觉降低56%
待验证70%
6月3日
3D魔方游戏测试中Claude的魔方无法打乱,GPT 5.1无法显示魔方
待验证70%
6月3日
在SVG动画生成测试中,Claude生成的猫狗形象清晰可辨,GPT 5.1生成的动物难以分辨
待验证70%
6月3日
Claude Sonnet 4.5生成了51000+总字符(中文12000+字),GPT 5.1仅生成31000+总字符(中文6900字)
待验证70%
6月3日
GPT-5.5在GPQA博士级科学推理基准上从78.5%提升到85.6%
待验证70%
6月3日
在B站UP主的四轮实测中,DeepSeek-V4在世界知识、上下文记忆和逻辑推理三个环节的交付质量上优于GPT-5.5
待验证65%
6月3日
GPT-5.5在AIME 2025数学竞赛上得分从65.4%提升到81.2%
待验证70%
6月3日
GPT-5.3首次采用了模型自身生成的AI代码来反向输送给模型进行训练与部署的自训练机制
待验证35%
还有 40 条时间轴事件