[控场AI]
· 7 分钟阅读· 3,650 字

ChatGPT Astra + Blender + Higgsfield:AI三维创作工作流实测

ChatGPT Astra + Blender + Higgsfield:AI三维创作工作流实测

UP主演示用Astra串联Blender与Higgsfield,将创意图片转化为可交互三维模型、结构PDF和漫游视频的完整工作流。

一位B站UP主展示了以ChatGPT Astra为核心协调者,串联开源三维软件Blender与AI创意平台Higgsfield的多步骤自动化工作流。演示从乐高积木案例入手:上传一张图片,Astra驱动Blender生成每块积木均独立可选的三维模型,再通过Higgsfield重建视觉细节,最终输出可交互3D模型、记录零件数量与材质的PDF文档,以及展示积木依次散开的爆炸视图视频。进阶案例则更进一步,将概念图转化为可在浏览器中点击漫游的交互式HTML场景,并生成带专业转场效果的30秒房产导览视频。整套流程通过MCP协议插件实现,用户全程无需离开ChatGPT界面。作者同时介绍了Zapier MCP可作为桥梁接入9000余种应用的扩展思路。文章最后提示,上述演示尚缺第三方验证,应视为工作流探索而非严格评测。

从想法到完整工作空间:一次AI三维创作的演示

一位B站UP主展示了一套令人耳目一新的AI创作工作流:从一个简单的想法出发,最终得到了包含完整办公空间蓝图、可交互三维模型和电影级漫游视频的成品。整套流程的核心,是将OpenAI的ChatGPT Astra、开源三维软件Blender以及AI创意平台Higgsfield三者串联起来。

作者在演示中反复强调一个关键点:过去的图像和视频生成模型有一个天然缺陷——它们对物体缺乏真正的"三维理解"。生成出来的画面看起来很像那么回事,但本质上只是二维像素的拼接,无法拆解、无法测量、更无法交互。而这次尝试要解决的,正是这个问题。

用乐高积木案例拆解工作流

为了让演示更直观,作者选取了一张物体图片,目标是将它转化为一个由乐高积木构成的三维结构。他解释了为什么必须用Astra来做这件事:模型不只是整体生成物体,而是能生成每一个独立的乐高积木块,每一块都是可单独选择、操作的三维对象。

提示词本身相当简洁:使用上传的图片,让Astra协调整个工作流程——先在Blender中生成模型(含每一个独立积木块),再用Higgsfield重构为详细的乐高结构,接着生成一份记录积木类型、颜色、数量的PDF,最后输出一段"爆炸视图"视频,展示结构如何分离成独立积木。整个流程还指定使用OpenAI新发布的ChatGPT Image 2.5作为图像模型。

作者特别提到,之所以能精确得知模型由多少个独立零件构成,正是因为借助了Blender的渲染信息——这是纯生成式模型做不到的。

通过插件连接Higgsfield

实际操作中,第一步是把ChatGPT连接到Higgsfield。作者演示了具体路径:进入左侧的"插件(Plugins)"选项,搜索Higgsfield,点击其MCP链接,选择ChatGPT后添加插件并连接账户即可。

我们要转到左侧的插件

完成连接后,用户无需再进入Higgsfield平台,就能直接在ChatGPT界面内调用其图像和视频模型。作者形容Higgsfield是一个"一体化AI创意平台",聚合了各类顶级图像与视频模型,而通过MCP连接后,Astra的智能可以直接调度这些能力。

值得关注的是整个流程的耗时。作者坦言,这类复杂端到端工作流并不快,乐高案例大约需要10到15分钟才能跑完——因为它要先在Blender中建模,再用Higgsfield重建结构,生成PDF,最后输出爆炸视图视频。这是一个真正意义上的多步骤自动化任务。

MCP(Model Context Protocol)是Anthropic于2024年底提出并开源的一套标准化协议,旨在解决AI模型与外部工具、数据源之间的集成难题。在此之前,每个AI平台要接入外部服务,都需要各自开发定制化的API适配器,成本高且难以维护。MCP将这一过程标准化:只要服务提供方实现了MCP服务器,任何支持MCP的AI客户端(如ChatGPT、Claude、Cursor等)都能通过统一协议调用它的能力。用户在ChatGPT中添加Higgsfield插件时,本质上是在告诉Astra"这里有一个MCP服务器,你可以通过它调用Higgsfield的图像和视频生成功能"。Astra随后可以自主决定何时、以何种参数调用这些工具,而无需用户手动切换平台。这正是文章中"无需离开ChatGPT界面"的技术基础。

成品:可交互模型 + 详细PDF + 爆炸视频

最终输出分为三部分。左侧是最初的参考图,右侧是Blender生成的3D渲染图——作者可以逐个点击选择单独的乐高积木,证明这是一个完整的三维交互式模型,而非静态图片。此外还有来自Higgsfield的视频输出,展示每一块积木依次散开的效果。

我们现在还得到了这份PDF

更有意思的是自动生成的PDF文档。它详细拆解了物体中的每一个独立部件,准确显示零件数量、材质、颜色和目录条目,甚至细分了每种颜色的乐高积木各有多少个、每一块的确切形状。作者认为,这种"设计一致性"贯穿整个输出的能力,是Astra之前的模型无法实现的。

扩展连接:Zapier MCP打通9000+应用

作者进一步指出,如果在插件页面找不到想连接的应用,可以借助Zapier MCP这个"桥梁",将超过9000种应用直接接入ChatGPT、Codex乃至Claude。

要添加应用程序

配置流程也不复杂:点击"添加MCP服务器",选择ChatGPT,开启开发者模式,复制URL创建插件并命名,粘贴Zapier MCP的URL即可完成连接。之后添加任意应用只需搜索、点击几个按钮。作者称自己每天都在Grok、ChatGPT、Claude等平台上使用它,用于邮件营销工具Drip的账户信息、订阅者数据等场景。

Zapier是一个专注于应用自动化的平台,其核心能力是通过预构建的连接器(Zap)将不同软件的事件与动作串联起来,例如"收到邮件时自动更新电子表格"。其用户群体主要是非技术人员,平台积累了超过7000个应用的集成。Zapier MCP则是其在AI工具爆发背景下推出的新产品形态:将这些已有集成封装成MCP服务器,使AI模型可以直接调度这些应用的功能,而不只是按固定规则触发自动化流程。相比传统Zapier自动化的"事件-动作"线性模式,通过MCP接入AI后,模型可以根据上下文动态判断要调用哪个应用、传入什么参数,灵活度大幅提升。对于没有工程能力自建工具集成的个人用户而言,Zapier MCP是当前接入长尾应用最低门槛的路径之一。

进阶案例:打造完整创作者工作室

视频后半段展示了一个更复杂的综合案例,整个流程约耗时一小时。作者先用Higgsfield生成了一个完整创作者工作室的概念图和几张参考图,用来确立办公室的美学风格。

随后,Astra调用Blender把概念图转化为可操作的三维世界。作者强调,Blender过去是设计师专属的专业软件,而现在借助Astra的智能,普通用户不仅能生成独立三维物体,还能生成整个场景——沙发垫、椅子、摄像机、灯光设置都是彼此独立的物体,而非一整块画面。这类能力可用于房地产蓝图,或单纯用来预览"理想办公室"的样子。

而不是仅仅像一段视频

接下来更进一步:Astra把Blender文件转化成一个可交互的HTML页面。用户可以点击场景中的每个区域——比如播客角落或拍摄区,视角就会切换过去,甚至能在这个虚拟世界里"走动"环顾四周。

最后一步是视频生成。作者提供了一段YouTube房产导览视频作为风格参考,希望模仿其中的转场效果。他特别指出,Astra擅长计算机操作,因此能够"实际观看"这段参考视频并捕捉想要的风格。最终Higgsfield使用Cadence 2.5生成了一段30秒的完整视频,带有缩放、切换等转场效果,而全程无需离开ChatGPT界面。

Blender是一款开源免费的三维内容创作套件,涵盖建模、材质、动画、渲染、视频剪辑等全流程功能,由非营利组织Blender Foundation维护。它的核心优势在于每个场景中的物体都是独立的"对象"(Object),拥有自己的几何数据、材质和变换属性,可以被单独选中、移动、修改或导出。这种数据结构与AI生成的二维图像有本质区别——后者只是像素矩阵,没有"哪里是椅子、哪里是墙"的语义层。当Astra调用Blender时,它实际上是通过Blender的Python API脚本化地创建场景:每条指令对应生成一个具体对象并设置其属性。这也解释了为什么文章中强调"沙发垫、椅子、摄像机、灯光都是彼此独立的物体"——这不是描述效果,而是Blender内部数据结构的直接体现,使得后续的点击交互、视角切换乃至爆炸视图动画成为可能。

一点观察

这套演示的价值不在于单一模型有多强,而在于"编排"本身:Astra扮演的是协调者角色,把Blender的三维精度、Higgsfield的视觉生成能力、以及文档整理能力串成一条完整流水线。三维理解能力的引入,让AI输出从"看起来对"迈向"可拆解、可测量、可交互"。

需要提醒的是,本文内容基于单一UP主的演示,其中涉及的ChatGPT Astra、Image 2.5、Cadence 2.5等产品命名与能力描述均来自该视频,尚缺乏第三方交叉验证,读者可将其视为一次工作流探索的展示而非严格评测。真实使用体验、稳定性和成本,仍有待更多实践检验。

分享:

相关推荐