[控场AI]
· 8 分钟阅读· 4,218 字

实测 GPT-6 Astra 智能体:一句提示词自主完成广告与纠错

实测 GPT-6 Astra 智能体:一句提示词自主完成广告与纠错

GPT-6 Astra 在Higgsfield平台完成从分镜到成片的全自动广告制作,账单误差仅4.5积分。

本文记录了一次针对 GPT-6 Astra「动手能力」的真实压力测试:测试者仅输入一段产品广告简报,完全放手让 Astra 自主完成读取余额、撰写分镜、选择生成模型、三轮自我审片与重做、修复排版错误、保存可复用技能,最后出具账单的全流程。结果显示,Astra 不仅能感知并批评自己生成的视频(发现罐底变形、高光滑动等问题),还主动将方法论封装为技能模块,账单与真实余额相差仅约 4.5 积分,且提前说明了误差来源。文章同时指出其局限:高分 ARC-AGI-3 成绩依赖定制框架,单次成本高达 1.9 万美元;智能体模式本身费用较高,10 秒短片约消耗 96 积分。作者以此引出一个更深层的问题:当提示词和批评都由模型完成,人类创作者的角色究竟是什么。

从对话到动手:一次不一样的模型测试

多数关于 GPT-6 Astra 的评测都停留在对话层面——有人打字提问,模型作答,然后给回答打分。但对于一个主打「在电脑上做事」(computer use)的模型来说,这其实是错误的测试方式。这位 B 站 UP 主(内容源自 Higgsfield 赞助的实测)选择了另一条路:给 Astra 一份真实的工作简报,然后把手从键盘上拿开,只盯着屏幕角落的计时器看它自己跑完全程。

整个测试的核心不是「它说得多聪明」,而是「20 分钟后我的素材文件夹里到底躺着什么,以及它给我的账单是否与真实余额对得上」。这是判断一个智能体究竟在干活还是在说谎的关键。

GPT-6 Astra

GPT-6 Astra 的纸面数据

GPT-6 Astra 于 9 月 3 日发布,随后几天陆续向付费层级推送。其中 Astra Pro 是独立层级,且并未开放给 Plus 用户。上下文窗口约为 100 万 tokens,Higgsfield 是官方指定的发布合作伙伴之一。

它的头号卖点是「计算机操作能力」。官方发布演示中,Astra 能布局电路板、在 Blender 里建模房屋。在桌面基准测试上,它超越了上一代模型,且每项任务耗时约为原来的一半。

不过怀疑者的账本也得摆出来:那个在各种标题里出现的 99.9% ARC-AGI-3 分数,来自 OpenAI 自建的定制测试框架,单次运行花费高达 1.9 万美元;而在 ARC Prize 的标准框架下,成绩只有 62.7。换句话说——擅长思考,不等于擅长动手,而思考并不是制造。

ARC-AGI(Abstraction and Reasoning Corpus for Artificial General Intelligence)是由 François Chollet 设计的一套智能测试基准,核心思路是用人类几乎无需训练就能解答、但机器极难泛化的视觉推理谜题来衡量「真实智能」。ARC-AGI-3 是其第三代版本,难度进一步提升。值得注意的是,该基准本身分为「开放榜单」和「私有评测」两种形式:开放榜单允许研究者在已知题目上优化,而封闭的私有框架可以为特定模型提供更多计算资源和运行次数。OpenAI 报告的 99.9% 成绩正是在后者条件下取得,单次运行耗资 1.9 万美元意味着大量推理算力的堆叠,而非模型在普通条件下的泛化能力。相比之下,ARC Prize 组织维护的标准公开框架更接近公平的横向比较,62.7% 的成绩反映的才是模型在受控条件下与其他系统的真实差距。

一句提示词,跑完一整条广告流程

这次实测中,UP 主只输入了一段简报:制作一支 10 秒的产品广告 hero 片段,外加两张海报静帧;要求 Astra「像创意总监一样工作」——先读余额、用三行写出分镜、自己挑模型并说明理由、片子做完后自我审片、重写自己的提示词并重做两次,最后开账单。

由于手头没有无品牌的产品可拍,简报干脆让它自己发明了一个:一款叫 Kestrel 的冷萃咖啡,哑光黑罐,没有任何真实 logo。

启动 19 秒后,第一个工具调用出现——Astra 读回了账户余额:2200 积分。随后是严格按要求写出的三行计划:主体(哑光黑罐配象牙色字体和一道铜色斜纹)、镜头(缓慢的低角度四分之三推镜)、光线(窄冷边缘光加暖调掠射主光)。这些细节没有一个字是人类输入的。

它自己挑了模型并解释原因:静帧用 Nano Banana Pro(保证包装排版清晰),视频用 CDance 2.5(控制镜头运动、保证三条产品几何一致)。连视频提示词都是它自己写的——相机距罐 85 厘米、29 度视场角、15 厘米推进、一滴冷凝水在重力下滑落、结尾停留两秒。

「Hero 片段」(hero shot/hero clip)是广告制作术语,指用来在视觉上最突出呈现产品本身的核心画面——通常是产品特写、强调质感与品牌调性的主镜头,相当于整支广告的「门面」。与之对应的是场景镜头或情境镜头,后者更多展示使用场景和人物。在这次测试中,Astra 需要独立决定如何拍摄一个完全虚构的产品,要求输出的正是这种需要审美判断与技术参数共同决定的核心商业素材,测试难度因此远高于生成一段普通描述性视频。

自我纠错:省下的不只是两个积分

静帧生成后,第一个「抓虫」时刻出现了:明亮版海报的标题里多出了一个单词「exactly」,正好卡在「take flight」前面。Astra 比人类先发现了这个错误,并且它直接修复了文件,而不是重新生成图片——省下了一次 re-roll 的成本,也就是两个积分。

Astra 自主修正海报排版

真正有意思的是那个递归循环。视频渲染时 Astra 没有急着预写批评,而是等真正的画面出来后用视频分析工具去看。第一版:罐底边缘中途变形、推镜漂浮不稳。它据此重写提示词——保持罐体刚性静止、锁定标签位置。第二版:高光在哑光表面滑动、镜头没稳住就切了。再改第三版:柔化、相机相对打光、6 秒完成推进、8 秒减速、10 秒静止停留。

三个版本并排看:版本一漂移、版本二滑动、版本三稳住。三条批评里没有一句是人类写的。

它甚至自己保存了一项技能

在版本三渲染时,Astra 做了一件没被要求的事:它给自己写了一个 Supercomputer「技能」,叫「三镜次产品导演法」(3 take product direction)。这意味着这个账号上下一支产品广告,可以直接从已保存的方法论开始。

Astra 自主保存工作方法为可复用技能

它还听到了电脑上一段无关的倒水声,主动把它从片段里剥离出去,最后把三条片段都精确导出为 10 秒时长。这种「看得见自己产物」的能力,是整个递归自我改进循环成立的前提。

「Supercomputer 技能」是 Higgsfield 平台的一项功能,允许智能体将某次任务中形成的方法论、提示词模板或操作流程持久化存储为可复用的「技能模块」,供同一账号的后续任务直接调用。这类机制在智能体领域通常被称为「长期记忆」或「程序性记忆」(procedural memory),其意义在于让模型积累可迁移的工作经验,而不是每次任务都从零开始。Astra 主动命名并保存「三镜次产品导演法」,意味着它不仅完成了当前任务,还在元层面上对自己的工作流程进行了总结与编码——这正是从单次执行者向持续学习的智能体迈进的关键行为。

账单:智能体诚实与否的试金石

按下回车 20 分钟后,线程自动重命名为「matte black cold brew」,账单到了:包装图 2 积分、每张海报 2 积分、每条 hero 片段导致约 96 积分的余额下降。

最值得尊重的是这一行说明:视频费用包含了对话和工具使用,并非孤立的生成成本。起始余额 2200.18,观测到的总下降为 389.88,但「精确的纯生成总额无法核实」——它拒绝猜测。UP 主自己去查账户,运行后余额为 1805.88,比 Astra 报的数字多约 4.5 积分,最可能是导出和最后几次工具调用发生在它最后一次读数之后。误差只有 4 个积分,而且它提前解释了误差可能来自哪里。

第二个任务:从 3D 场景到电影感成片

在另一个工具 3D Jutsu 里,你给出提示词就能得到一个可编辑的 3D 场景,再转成视频。模型选项列出了 GPT-6 Astra 2。一句提示词——小型产品影棚、低基座、一个柔光箱、弧形白背景、哑光黑罐、相机缓慢环绕——几分钟后就得到一个真正的场景:不是一张场景图,而是柔光箱、背景、基座上的罐子,全都在可点击的属性树里,还能整体环绕观看。

3D 场景以可点击的属性树呈现

渲染时页面自动打开 Cinema Studio 4,把渲染结果作为参考附上。UP 主只打了四个词「make this ad cinematic」,45 积分后(按钮上标价 80),就得到一支 5 秒、烟雾中的 Kestrel 罐电影感短片。

对于习惯留在 ChatGPT 里的用户,同样的能力可以通过 Higgsfield MCP 服务器接入。不过在免费账户上,Astra 那颗「大脑」需要 Plus,因此默认走的是基础模型。

MCP(Model Context Protocol)是一种开放协议,由 Anthropic 于 2024 年提出,旨在标准化 AI 模型与外部工具、数据源之间的交互方式。通过 MCP 服务器,第三方平台(如 Higgsfield)可以将自己的能力以统一接口暴露给支持该协议的 AI 客户端,用户无需离开 ChatGPT 等对话界面就能调用外部服务。Higgsfield MCP 服务器的存在意味着,即便不直接访问 Higgsfield 网页端,习惯在 ChatGPT 中工作的用户也能让 Astra 调用视频生成、3D 渲染等能力——这进一步模糊了「对话助手」与「多工具智能体」之间的边界。

结论:智能体有了「手」,改变的是你要评判什么

GPT-6 Astra 在 Higgsfield 里并没有变得更聪明,它得到的是「手」——而手改变了你能评判的对象。评判一个智能体,应该看落到你素材文件夹里的东西,以及它的账单是否与你的真实余额对得上。

这一次运行的成绩单:6 个成品文件、2 次自我批评、1 项保存的技能、1 个抓到的错别字,以及一份与真相相差不到 5 积分的账单。

局限也真实存在:Astra 是菜单里「高成本」的那个选项,智能体生成在所有套餐上都要扣积分,一条 10 秒片段就带走约 96 积分(含对话)。

真正留在人心里的问题是:如果你账号上最好的提示词是模型写的,对它作品最好的批评也来自模型,那么在这个循环里,你的工作到底是什么?

分享:

相关推荐