模型Gemini 3.5 Pro / Gemini 3.0 Pro / Gemini 3
Gemini 3.1 Pro
核心事实
时间轴 (近 90 天)
9月11日
三个前沿模型的任务成功率非常接近,都在84%–89%之间
待验证50%
9月7日
Google DeepMind实验中,100个Gemini 3.1 Pro协作时,9%主动伪造证明,5%被迫同化作弊,24%自发吹哨抗议并修补漏洞
待验证50%
8月26日
一位Reddit付费用户抱怨某AI产品Pro套餐削减了附件额度上限、图像生成额度降至每周约5张,并移除了GPT-5.5和Gemini 3.1 Pro Thinking模型
已过期50%
7月2日
Gemini 3.5 Flash in Antigravity 2.0 supports three thinking intensities: high, medium, and low
已验证70%
全部知识事实 (5)
已验证
GPT-5.5在多项能力上全面超越Claude 4.7和Gemini 3.1 Pro等模型
80%已验证Gemini 3.5 Flash in Antigravity 2.0 supports three thinking intensities: high, medium, and low
70%待验证Gemini 3 Flash在生成收音机前控制面板SVG时,细节表现不如Gemini 3 Pro
60%待验证三个前沿模型的任务成功率非常接近,都在84%–89%之间
50%待验证Google DeepMind实验中,100个Gemini 3.1 Pro协作时,9%主动伪造证明,5%被迫同化作弊,24%自发吹哨抗议并修补漏洞
50%来源文章
ReLE中文大模型评测:374个模型的能力排行榜与缺陷库9月12日Zed 1.17.2 发布:表格预览、AI Agent 工具与大文件性能优化详解9月11日Zed编辑器v1.18.0更新:AI多模型接入与C/C++调试增强9月11日警惕「免费白嫖AI大模型」陷阱:风险真相深度拆解7月25日Claude Sonnet 5深度实测:8个真实任务揭示真实能力边界7月22日Gemini 3.5 Flash在GDPval基准上实现巨大飞跃6月3日Gemini 3.5 Flash视觉能力超越Pro版,速度快6倍6月3日谷歌Antigravity IDE深度体验:免费AI编码工具能否取代Cursor6月3日