Gemini 3.6 Flash实测:免费模型性能逼近顶级,成本降低65%

Google三连发:主打更快更省的AI Agent
在AI大模型竞争白热化的当下,Google一口气发布了三款全新的Gemini模型:Gemini 3.6 Flash、Gemini 3.5 Flash Lite以及Gemini 3.5 Flash Cyber。这三款模型的核心目标只有一个——让AI Agent更快、更聪明、更具性价比。
所谓AI Agent(智能代理),是指能够自主感知环境、制定计划并执行多步骤任务的AI系统。与传统的单轮问答式大模型不同,Agent具备工具调用、记忆管理、任务分解和自我纠错等能力。例如,一个AI Agent可以自动浏览网页、调用API、编写并执行代码、处理文件,完成一个完整的工作流程,而不仅仅是回答一个问题。2024-2025年,Agent被业界普遍认为是大模型落地的核心方向,Google、OpenAI、Anthropic等厂商都在围绕Agent能力展开激烈竞争。正是在这一背景下,Google此次发布的三款模型都将Agent场景作为第一优先级。
其中最值得关注的当属Gemini 3.6 Flash。根据B站UP主零度解说的分析,官方公布的数据显示,它在Agent任务、代码生成等多项基准测试中全面超越了上一代模型。尤其在编写生产级代码方面提升明显,不仅生成速度更快,而且更不容易陷入死循环。
更引人注目的是,这款性能大幅提升的模型是完全免费的。目前它已经在网页端、手机App以及Anti-Gravity开发平台上全面上线,所有人都可以直接体验。
性能数据:逼近顶级推理模型
据零度解说援引的官方数据,Gemini 3.6 Flash在多个维度表现亮眼:
- 在某项深度基准测试中已经拿到接近满分的成绩,据称已达到Claude Opus级别推理模式的水平;
- 在著名前端开发社区的评分中直接拿到1537分,从上一代的第21名跃升到第12名;
- 在设计、营销、游戏、内容创作等多个分类中都进入了前10和前20。
值得一提的是,在这个印象中"速度快但能力一般"的Flash系列上,这一次的表现确实让不少观察者感到意外。Flash系列最初的定位是以牺牲部分推理深度换取更低延迟和更低成本的"轻量级"模型,主要面向对速度敏感的应用场景。而此次3.6版本在保持速度优势的同时大幅拉近了与旗舰Pro系列的能力差距,某种程度上模糊了两条产品线之间的边界。
Gemini 3.6 Flash的Token效率:使用成本几乎腰斩
这次最大的惊喜其实不只是能力提升,更在于token效率。多位实测开发者反馈,Gemini 3.6 Flash在完成相同任务时,输出的token数量明显更少。
这里有必要解释一下token效率为什么如此重要。Token是大语言模型处理文本的基本单位,大约相当于一个英文单词或2-3个中文字符。API调用费用通常按输入和输出的token数量计费。Token效率高意味着模型能用更少的"废话"完成同样的任务——减少冗余解释、避免重复生成、直奔要点。这对大规模生产环境至关重要,因为一个Agent在执行复杂任务时可能需要进行数十次甚至上百次模型调用,每次调用的token节省都会在总成本上产生乘数效应。
据零度解说整理的数据,相比其他模型,它的token输出量减少了约65%,整体使用成本降低了将近一半。这意味着它不仅性能更强,而且更加省钱——对于需要大规模调用API的Agent应用来说,这是一个极具吸引力的组合。
在API成本对比中,同一测试任务下:GPT系列花费约1.8美元、Claude约1.5美元、Kimi约0.5美元,而Gemini 3.6 Flash的总成本最低,仅约0.1美元左右。这种成本优势在实际生产环境中的价值不容小觑。考虑到一个中等规模的Agent应用每天可能产生数百万次模型调用,单次调用节省的几分钱在月度账单上可以转化为数万美元的差异。
多模态实测:精确计数展现空间分析能力
评分终究只是评分,真正好不好用还得靠实测检验。零度解说用了几个刁钻的任务来验证Gemini 3.6 Flash的多模态能力。
多模态(Multimodal)是指模型同时处理和理解文本、图像、音频、视频等多种信息类型的能力。在计数测试中,模型需要完成的不仅是"看到"图片,还要进行空间分割、物体边界识别、重叠判断和逻辑推理等复杂操作。这种能力依赖于视觉编码器(Vision Encoder)将图像转化为模型可理解的向量表示,再与语言推理能力结合。精确计数一直是多模态模型的短板之一,因为它要求像素级的细粒度理解而非笼统的场景描述。

第一个测试是让模型数一张密密麻麻的牙签图。模型将图片分成五个区域分组计数,最终给出"总数约70根,误差1-2根"的判断。而实际真实数量是71根。考虑到图中确实有几根牙签存在重叠,这个结果已经相当出色,展现了不错的多模态理解与空间分析能力。值得注意的是,模型采用的"分区计数"策略本身就体现了较高的推理水平——它并非试图一次性数清所有对象,而是像人类一样将复杂问题分解为更小的可管理单元。
第二个测试降低了难度,让它数一组麻辣烫签子。模型按区域拆解:"最上方1根、左侧4根、中间5根、右侧7根,共17根",经过人工逐一核对完全正确。对于这种细小物体的精确计数,模型的表现证明了其多模态感知的可靠性。
代码生成能力实测:从小游戏到3D物理引擎
代码能力是这次Gemini 3.6 Flash主打的重点。零度解说进行了两组测试。

水果忍者小游戏一次跑通
第一个是让模型编写一个水果忍者游戏。生成的代码下载运行后,游戏运行流畅,音效完整,切水果、炸弹判定等基础玩法都正常工作,一次性就跑通了。
真实物理效果的3D台球游戏
更复杂的测试是要求制作一个具有真实物理效果的3D台球游戏,需要包含碰撞、摩擦、球带反弹以及力度控制。
物理引擎是一种模拟真实世界物理规律(如重力、碰撞、摩擦、弹性)的软件库,常见的有Bullet、PhysX、Cannon.js等。让AI一次性生成包含物理引擎逻辑的完整可运行代码,意味着模型不仅要理解编程语法,还要掌握物理学公式的工程实现——比如碰撞检测算法、向量运算、能量守恒的近似模拟等。能将这些打包进一个HTML文件通过浏览器运行,说明模型对WebGL/Canvas渲染管线和JavaScript物理库都有成熟的理解。
模型基于物理引擎生成了一个完整的3D台球游戏,全部封装在一个HTML文件中,浏览器打开即可运行。实测中,鼠标移动瞄准会显示预测碰撞点的虚线,按住左键蓄力(力度条从红变绿)后击球,球与球杆的碰撞、库边反弹、滚动摩擦导致的减速停止都表现得相当自然,六个球袋的落袋判定也正常工作。能一次性生成这样级别的物理模拟效果,确实展现了不俗的工程能力。
Agent能力实测:GitHub分析与文档批处理
借助Google自家的Agent开发平台Anti-Gravity(反重力),零度解说进一步测试了模型的工具调用与代理能力。
Anti-Gravity是Google推出的AI Agent开发平台,它提供了一个集成环境,让开发者可以快速构建、测试和部署基于Gemini模型的Agent应用。该平台的核心价值在于将工具调用(Tool Use)、代码执行沙箱、文件处理、网络访问等Agent所需的基础设施封装为即用型服务,开发者无需自行搭建复杂的编排框架(如LangChain或AutoGen)。这类平台代表了大模型应用从"对话"向"自动化执行"演进的基础设施层趋势。

GitHub项目分析与代码结构解析
第一个任务是让模型打开GitHub,找到Star数最高的AI Agent项目并分析代码结构。模型通过调用Python脚本迅速完成,返回结果显示排名第一的项目Star数约38.4万,第二名约22万——经人工核对数据真实无误。随后它还对排名第一的项目进行了深度解析,包括项目介绍、核心代码、目录结构和框架设计拆解,完全按要求完成。整个过程速度极快。
这个测试验证的是Agent的核心工作模式:接收高层目标→分解为具体步骤→调用工具执行→整合结果呈现。模型需要自主决定使用GitHub API还是爬虫脚本、如何排序筛选、代码结构分析到什么粒度,这些决策都不在提示词中明确指定,而是由模型自主规划完成。
100+PDF批量处理输出Markdown
第二个测试是文档处理能力。面对100多个PDF文件,要求找出所有API更新并以Markdown格式输出。模型同样调用Python脚本批处理这批文档,最终以规整的Markdown格式输出结果,稳定完成了这项繁琐任务。这类批量文档处理正是企业级Agent应用最常见的落地场景之一——将大量非结构化文档转化为结构化可检索的信息。
争议与不足:创意任务上并非全面碾压
当然,并非所有反馈都是一边倒的好评。

网上也有人认为Gemini 3.6 Flash在某些创意设计任务上不如上一代的Gemini Pro好用。例如同样是设计金门大桥,两代模型生成的效果各有千秋,究竟哪个更好,很大程度上取决于个人审美——所谓萝卜白菜各有所爱,众口难调。在几组不同模型生成的3D场景对比中,效果的优劣也没有绝对定论。
这提示我们:基准评分和成本优势是硬指标,但在创意审美类任务上,Flash模型是否能全面超越更大的Pro模型,仍需根据具体场景判断。这也符合业界对模型蒸馏(Distillation)的普遍认知——通过知识蒸馏将大模型能力压缩到小模型中时,逻辑推理和结构化任务通常保留得较好,而开放式创意生成中的多样性和"灵气"有时会有所损失。
总结:生成式AI开发的新拐点
最令人印象深刻的一个演示,是Gemini 3.6 Flash在Anti-Gravity中一次性生成的3D风机安装动画——重型卡车运输叶片上山、履带式起重机吊装、精准安装到塔顶的完整施工流程,全部由AI自动生成。
这类演示的价值不在于画面炫酷,而在于AI已经能够理解整个工程的施工流程和空间关系。以前做这种工程级3D演示可能需要建模师花上几天甚至几周,而现在只需一句提示词、几分钟就能获得可交互的演示雏形。这代表着从"AI辅助创作"到"AI自主生产"的质变——模型不再只是提供建议或片段,而是直接输出可用的完整工程产物。
对于Agent应用开发者而言,Gemini 3.6 Flash的免费策略叠加接近腰斩的成本优势,可能会显著改变模型选型的天平。虽然它未必在每个维度都是最强,但"够强、够快、够便宜"的组合,正是生成式开发规模化落地最需要的特质。在大模型逐渐从"比谁更聪明"转向"比谁更实用"的行业新阶段,Google此次的定价策略和性能平衡点的选择,可能比单纯的跑分排名更具战略意义。
相关推荐

NeurIPS投稿揭示AI时代科研协作新趋势
从一则Reddit招募帖分析NeurIPS Workshop投稿策略、AI编程工具如何重塑科研生产力,以及年轻研究者全球化协作的机遇与风险,深度解读AI时代学术科研的变局与新生态。

AQuA量化模型消融实验解读:IC提升0.023从何而来
深入解读AQuA混合量化模型的IC提升归因问题。分析为何0.023的IC差距需要消融实验验证,梳理特征工程、混合架构拆解、训练配方三大消融优先级,探讨量化研究方法论中的对照严谨性与可复现性。

非程序员用Claude从零构建Hugo网站:完整实践指南
详解非Web开发者如何借助Claude AI从零构建定制Hugo网站主题,包括org格式支持、暗色主题、卡片布局等功能实现,五分钟出雏形,数天迭代成型的完整建站过程。