Gemini API 实战:用文件构建 AI Agent

在 Google DeepMind 的这场官方实操分享中,两位产品经理 Mariano 和 Philip 分别从 AI Studio 的应用开发与 Interactions API 的 Agent 构建两个维度,系统展示了谷歌当前的 AI 开发工具链。核心信息只有一个:从想法到生产,正在变得前所未有地快,而构建 Agent 也不再需要写复杂的 Python 循环——你只需要写文件。
Gemini 生态:从模型到多模态
Mariano 首先回顾了 Gemini 家族的迭代节奏。从 Gemini 1.5,到广受好评的 Gemini 2.5,再到当前主打的 Gemini 3.5 Flash(分享中作者的日常首选模型),谷歌在前沿模型上保持了高频更新。同时,开源侧的 Gemma、生成媒体模型 Nano Banana 2、以及文本转语音(TTS)模型也在同步推进。
Gemini 3 之所以被 Cursor、GitHub、Figma、Vercel 等头部厂商广泛采用,关键在于其多模态能力。它可以接收系统指令、文本、图像、音频、视频、语音、URL 等多种输入,并输出文本、图像、音频、视频、函数调用或代码。
值得深入理解的是,多模态(Multimodal)指模型能够同时理解和生成多种类型数据的能力。传统语言模型只能处理文本,而多模态模型通过统一的表征空间(embedding space)将不同模态的数据映射到同一语义维度,从而实现跨模态的推理与关联。这背后依赖于 Transformer 架构的扩展——将图像切分为 patch、将音频转为频谱特征后与文本 token 一同输入模型。Gemini 从设计之初就采用原生多模态架构(natively multimodal),而非将独立的视觉、语音模块拼接,这使其在跨模态任务上表现更连贯。对开发者而言,这意味着一次 API 调用即可完成「看图说话」「听音识意」等复合任务,大幅简化了以往需要串联多个专用模型的工作流。
这种「混搭」能力让开发者能够构建过去难以实现的复合型应用。Mariano 举例说,他自己就搭了一个 Agent,通过 Workspace 集成读取收件箱,然后生成一段小播客,供早晨煮咖啡时收听。
AI Studio:从想法到应用的一站式平台
AI Studio(ai.studio / ai.dev)是这次分享的重点。它不仅是测试新特性的 Playground,更进化成了完整的应用构建环境。
全栈开发的零配置体验
Mariano 作为全栈 Web 开发者,最看重的是全栈 Node.js 应用支持。现在你可以在 AI Studio 内完成整个应用的搭建,平台会自动配置 Node.js 服务端与前端,提供完整的 npm 生态访问权限,并内置服务端 API 密钥的秘密管理。他坦言,认证和密钥管理一直是前端开发中最令人头疼的部分,而现在这些痛点被内置能力直接消解了。
此外,原生 Firebase 集成带来了开箱即用的「使用 Google 登录」认证、Firestore(NoSQL 数据库)的自动预置,未来还将支持 Cloud SQL。与 Workspace 的集成通过自动化 OAuth 实现,无需在 Cloud Console 手动配置,这大幅降低了对接 Gmail、Docs、Drive 等企业数据的门槛。
这里的 OAuth(Open Authorization)是一套开放的授权标准,允许第三方应用在无需获取用户密码的情况下,获得对用户在某服务上特定资源的访问权限。当应用需要读取用户的 Gmail 或 Drive 数据时,OAuth 通过颁发有时效、有范围限制的访问令牌(access token)来实现最小权限授权。传统上,配置 OAuth 需要在 Google Cloud Console 手动创建凭据、设置回调 URL、声明 scope 权限,流程繁琐且容易出错。而 API 密钥(API Key)则是标识调用方身份的静态凭证,一旦泄露即可能被滥用,因此「秘密管理(Secret Management)」将密钥存储在服务端加密保管、避免暴露于前端代码,是生产环境的基本安全实践。AI Studio 将这些能力内置化,正是在消解开发者长期面临的认证复杂度痛点。
自然语言生成原生安卓应用
一个被作者称为「game-changer」的能力是:通过自然语言生成原生 Kotlin 与 Jetpack Compose 应用。据 Mariano 透露,自上月发布以来,已有超过 100 万个应用被创建。整个流程无需本地环境配置,浏览器内即有模拟器实时运行,还支持一键安装到手机或一键发布到 Play Console 测试。
理解这一能力的分量,需要了解其背后的技术栈。Kotlin 是 JetBrains 开发、被谷歌于 2017 年确立为 Android 官方首选的编程语言,相比 Java 更简洁、空安全(null safety)特性更强,能显著减少崩溃隐患。Jetpack Compose 则是谷歌在 2021 年推出的现代化声明式 UI 工具包,开发者只需描述「界面应该是什么样」,框架自动处理状态变化时的重绘,取代了传统基于 XML 布局和命令式操作的繁琐方式。这套「Kotlin + Compose」组合是当前原生 Android 开发的主流范式。AI Studio 能够通过自然语言直接生成符合这一现代标准的代码,意味着生成的不是过时或玩具级的原型,而是可直接进入生产迭代的工程化产物,这也是「game-changer」评价的技术底气所在。
提升开发效率的细节改进
AI Studio 还引入了多项体验优化:
- 聚焦标注模式(Focus Annotation):直接点击页面某个组件,就能针对该组件精确下达修改指令,不必再费力用文字描述「英雄区下方第二段落的标题」。
- 设计预览(Design Previews):模型生成过程中会先给出几种不同风格的低保真预览(如高密度活泼、优雅暗色、沉浸式 UI),开发者可提前选定风格,避免生成完成后再返工。
- Tab 自动补全:针对提示词的写作瓶颈,输入几个字后停顿片刻,模型即实时补全并增强你的 prompt。

无缝导出到本地
当你在 AI Studio 中构建到一定阶段、想回到熟悉的 IDE(如 Anti-Gravity)继续开发时,可以一键导出——不丢失任何上下文、历史记录,代码结构清晰,甚至会询问是否连同密钥一起导出。Mariano 现场演示了一个「每日拉伸」应用,从提示词到可运行的暗色主题 App,包括 Nano Banana 生成的图片,全程近乎零手工介入。
Interactions API:统一的 Agent 接口
下半场由来自德国的 Philip 介绍了正式 GA(General Availability)的 Interactions API——谷歌全新的统一接口,用于调用 Gemini 模型和 Gemini Agent。

从「回合制」到「步骤化」数据模型
Philip 指出,AI 应用正从简单问答转向 agentic 用例——我们定义任务和目标,让模型去达成。为此,Interactions API 做了几项关键设计:
- 模型与 Agent 统一:用同一套代码即可选择使用 Gemini 模型,或使用 Anti-Gravity、Deep Research 等 Agent。
- 告别 user/model 回合制:过去 ChatGPT 时代的「用户输入—模型输出」交替结构,已无法承载推理(reasoning)、函数调用、函数结果这些新的复杂交互类型。Interactions API 转向步骤化(steps)数据模型,每种交互都成为独立数据类型,既方便开发者构建,也让模型更易推理。
- 服务端状态管理:只需发送新输入并提供上一轮的 ID,API 自动维护上下文(也可选择自行管理)。
- 异步后台执行:针对长时任务,创建请求后返回一个 ID,通过轮询获取状态或流式接收事件更新。
- 一方与三方工具混用:过去 Google Search 无法与自定义函数一起使用,现在可以自由组合。例如构建一个搜索 React 最新 CVE 漏洞、再调用内部数据库的安全事件 Agent。
这里从回合制到步骤化的转变值得展开。早期对话式 AI(如 ChatGPT)采用「user/model」严格交替的回合制(turn-based)数据结构,每次对话被建模为用户消息与模型回复的往复序列。这种结构在纯问答场景下清晰简洁,但随着模型能力演进,出现了推理链(chain-of-thought reasoning)、函数调用(function calling)、工具执行结果返回等新交互类型——这些既非「用户输入」也非「最终回复」,硬塞进回合制框架会造成语义混乱。步骤化数据模型将每一次推理、每一次工具调用、每一个结果都建模为独立的、带类型的数据单元,形成一条可追溯的执行轨迹。这不仅让开发者更容易解析和调试 Agent 行为,也为模型自身提供了更结构化的上下文,有助于其在长链条任务中保持推理的连贯性。
远程环境:托管的隔离沙箱
一个 environment 参数是 Interactions API 的独特之处。远程环境是运行在 Google Cloud 内的隔离沙箱,Agent 可以在其中执行命令、创建文件,而无需在本地机器上做任何操作。

沙箱(Sandbox)是一种安全机制,将程序运行限制在受控、隔离的环境中,使其无法影响宿主系统或访问未授权资源。当 Agent 需要执行任意代码、安装依赖、读写文件时,直接在开发者本地机器运行存在巨大安全风险——恶意或错误的代码可能破坏系统或泄露数据。将执行环境搬到云端隔离沙箱中,本质上是容器化(如基于 gVisor、Firecracker 等轻量虚拟化技术)与云原生架构的应用。持久化能力则意味着沙箱状态在多次请求间保留,避免了每次都重新拉起环境、重装依赖的开销。
这些环境是持久化的:你先让 Agent 安装 Pandas 等依赖,后续请求就能直接用 Pandas 分析 CSV 文件,无需重复配置。资源可以通过 GitHub 仓库、GCS bucket 或内联文件挂载进环境,且支持私有仓库与私有 bucket。
首次启动沙箱约需 8 到 10 秒。Philip 现场演示时,Agent 报告了环境信息:Ubuntu、Linux、8 核 AMD 虚拟 CPU、15GB 内存,并预装了 Python、pip、curl。这 8 到 10 秒的冷启动时间反映了在安全隔离与启动效率之间的工程权衡,而 Ubuntu、多核 CPU、预装 Python 等配置则表明这是一个功能完整的类 Linux 工作站,足以支撑数据分析、代码构建等真实计算任务。
Agent 就是「文件的组合」
本场分享最颠覆认知的观点,是 Philip 对 Agent 本质的重新定义:
Agent 不再是那些奇怪而复杂的 Python 或 JavaScript 循环,我们只是写文件,然后把这些文件提供出去,就构建了自己的 Agent。

以现场演示的「AI 谈话电台」applet 为例,它的 agent 文件夹结构极其简单:一个 agents.md 文件定义角色(把任何内容转成电台节目),一份 workflow 描述工作流(先做研究、写脚本、生成语音、生成配乐、混音、生成封面图),再配上若干 skill。每个 skill 就是一段说明文档加一个 Python 脚本——比如 TTS 生成技能,其脚本调用 Interactions API 的 Flash TTS 模型。换言之,Anti-Gravity Agent 运行在 Gemini API 之上,通过 skills 反过来调用其他 Gemini 模型完成子任务。
配套的 Agents API 让你把「文件 + 环境」封装成可复用的 Agent,无需每次请求都重新提供资源配置。典型场景如构建一个 GitHub 代码评审 Agent:先让 Agent 安装 GitHub CLI,取得该环境的 ID,之后每次创建 Agent 都复用这个预装好 CLI 的环境。
谷歌还提供了一个实验性的 Gemini API CLI——它不是编码 Agent(区别于 Claude Code、Gemini CLI、Anti-Gravity CLI),而是专门用于调用 API、创建 Agent 的 API CLI。
凭证安全:网络代理机制
针对「Agent 调用 Gemini API 会不会滥用凭证」的疑问,谷歌构建了一层网络代理:一方面限定 Agent 可访问的 URL 或域名,另一方面提供 header 转换。真实凭证保存在代理层而非沙箱内,Agent 只知道自己「能调用 Gemini API」,当发起外部请求时,代理才注入真实凭证。这意味着凭证可随时轮换、移除,Agent 始终无法接触到真实密钥。
这一设计体现了「零信任(Zero Trust)」安全理念——即默认不信任任何环节,包括 Agent 自身运行的沙箱。传统做法是将 API 密钥注入运行环境,但一旦沙箱被攻破或 Agent 行为异常,密钥即面临泄露风险。网络代理(proxy)作为 Agent 与外部服务之间的中间层,扮演「凭证保管员」角色:Agent 发出请求时只携带占位标识,代理层在转发前才注入真实凭证并完成 header 转换,同时通过 URL/域名白名单限制 Agent 只能访问被允许的端点。这样,即便 Agent 代码被完全暴露,攻击者也无法从中提取真实密钥;而运维方可以在代理层随时轮换(rotate)或吊销凭证,无需改动 Agent 本身。这种「密钥与执行体分离」的架构,是构建可信托管 Agent 服务的关键安全基石。
关键结论
整场分享传递了三个清晰信息:
- AI Studio 让「从想法到生产」大幅加速,是所有开发的起点;
- Interactions API 已正式 GA,为 agentic 工作流提供统一、对齐多模态的接口;
- Agent 的本质是文件的组合,Markdown 加少量脚本即可定义功能强大的托管 Agent。
对于开发者而言,最直接的行动路径是:访问 ai.studio 获取 API 密钥(有慷慨的免费额度和可设置的花费上限),在 AI Studio 中快速搭建原型,再一键导出到 Anti-Gravity 深入开发。谷歌正在用「零配置」「一键部署」「文件即 Agent」的理念,系统性降低 AI 应用与 Agent 的构建门槛。
核心要点
相关推荐

抱怨如何侵蚀你的心智:注意力自我强化效应解析
习惯性抱怨正在训练大脑发现更多负面信息,形成恶性循环。本文从注意力自我强化机制出发,解析抱怨的心理侵蚀过程,并提供主动管理注意力、跳出负面循环的实用方法。

Steam恶意软件溯源:比特币、Cookie和外卖订单如何锁定攻击者
一起Steam恶意软件案件中,调查人员通过比特币交易链、Google Cookie和Uber Eats外卖订单三条线索交叉验证,成功溯源攻击者真实身份。深入解析数字取证技术与匿名幻觉。

Claude分享链接被谷歌收录索引:隐私风险与防护指南
Claude的分享对话链接和Artifacts可能被Google搜索引擎抓取收录,导致敏感信息公开泄露。本文分析技术根源、隐私安全影响,并提供用户自我保护的实用建议。