一句话生成仙侠壁纸:Skill加持下三大Agent实测对比

从一句大白话到东方仙侠大片
用AI画一张能当壁纸的东方仙侠图,需要多复杂的提示词工程?这次测试给出了一个反直觉的答案:只需要一句大白话,加上一个正确的"技能包"(Skill)。
提示词工程(Prompt Engineering)自2022年大模型爆发以来,已经从简单的关键词堆砌演变为一门系统性学科。早期的AI绘画用户需要掌握大量特定语法:权重标记、负面提示词、采样器参数、CFG值等,一段有效的Stable Diffusion提示词动辄数百个token。这种高门槛催生了提示词交易市场和专门的提示词优化工具。而Skill的出现代表了一种新范式:将提示词工程的复杂性封装为可复用的模块,用户无需理解底层机制即可获得专家级输出。
测试的核心命题很简单——同一句话,让AI画两遍。一遍装了名为"东方仙侠视觉导演"的Skill,一遍不装。结果差异之大,直接决定了那张图能不能拿去当桌面壁纸。
这次横向对比选取了三个Agent:Codex、WorkBody和Grog。有意思的是,Skill本身并不出图,它更像一个"导演"角色,真正的绘制能力还是取决于你手上那个Agent会不会"画"。这里需要理解Skill在AI Agent生态中的定位:它本质上是一组预定义的规则、约束条件和工作流模板,能够在Agent执行任务时注入特定的领域知识和决策逻辑。与传统的系统提示词(System Prompt)不同,Skill通常具备更强的结构化特征——它可以包含条件判断、参数约束、迭代规则等复杂逻辑,而不仅仅是一段描述性文字。这种设计思路源自软件工程中的"关注点分离"原则:将领域专业知识从通用执行能力中剥离出来,使得两者可以独立迭代和组合。

Skill安装速度:三大Agent表现对比
第一个观察点是Skill的自动安装能力。测试者只是把一句话丢过去,一个命令都没有手动敲,Codex就在1分23秒内自己完成了安装。
同样的操作在另外两家的表现是:
- WorkBody:58秒
- Grog:1分48秒
- Codex:1分23秒
单从安装速度看,WorkBody最快。但速度只是入场券,真正的差距在后面的执行环节。
Agent自动安装Skill的能力涉及多个底层技术环节:首先是意图识别——Agent需要从用户的自然语言输入中判断当前任务需要哪个工具;其次是环境配置——自动完成依赖检查、权限申请和运行时环境搭建;最后是验证确认——安装完成后进行功能性测试以确保工具可用。这一过程在传统DevOps领域被称为"零接触部署"(Zero-Touch Provisioning),如今在AI Agent领域的实现标志着Agent正从"被动执行者"向"自主行动者"演进。
这也说明了一个道理:Agent的自动化能力(能否零命令自主装配工具)已经成为衡量其成熟度的重要指标之一,而不再仅仅比拼生成质量。
Codex出图流程:先出方案再出图
输入的原始提示词是一句典型的大白话:
云海上一座长桥,尽头一扇仙门,还有一个人背对着站在桥中间。
收到指令后,Codex在24秒内先返回了一大段结构化的文字,而不是直接出图。这段返回包含三个部分:
- 完整的画面描述——可以整段复制带走的详细prompt;
- 负面清单——单列出"哪些东西不许出现";
- 三个可迭代方向——供后续继续调整的建议。

这种"先出方案、再出图"的工作流,本质上是把一个模糊的自然语言需求,翻译成了一份可执行、可复用的视觉规范。它把"运气成分"降到了最低。
其中负面清单在AI图像生成中扮演着至关重要的角色。从技术原理看,扩散模型(Diffusion Model)在去噪过程中,会将负面提示词对应的语义向量作为反向引导信号——即模型在每一步去噪时,不仅朝着正面描述的方向靠近,同时主动远离负面描述的方向。这种机制被称为Classifier-Free Guidance的负向条件。实践中,负面清单能有效抑制模型的"默认倾向",比如AI绘画模型在生成建筑时倾向于添加过多装饰细节,通过负面清单明确排除这些元素,可以实现更克制、更有意境的画面效果。
AI自我修正:自动返工机制
更值得关注的是生成过程中的自我修正。图在3分32秒出来,但中间Codex自己"返工"过一次。
它发现第一版"人物明显大于锁定的3%",于是主动拉远镜头、延长桥面,在原图基础上改了一版。这种基于自设规则的自动校验与迭代,是普通"一次性出图"工具所不具备的。
从技术架构看,这种自动返工属于"闭环反馈"(Closed-Loop Feedback)架构的典型应用。在这种架构下,系统不仅执行生成任务,还内置了评估模块对输出结果进行量化检验。具体到本案例中,系统在生成图像后会通过视觉分析(可能是目标检测或语义分割模型)计算人物在画面中的占比,当检测到偏离预设的3%阈值时,自动触发重新生成流程并调整构图参数。这种"生成-评估-修正"的循环在强化学习领域被广泛使用,如今被引入生成式AI工具链,代表了从"单次推理"到"迭代优化"的范式升级。

装Skill与不装Skill:效果差异实测
这是整个测试最核心、也最能说服人的部分。测试者坦言自己一开始并不相信:"图好看归好看,一句话谁不会写,凭什么装了就不一样?"
于是把Skill关掉,用同一句话再跑一遍,两张图摆在一起对比,差异一目了然。
差异一:桥栏杆的视觉留白
- 没装Skill:桥两边从头到尾全是雕花石栏杆,画面繁琐;
- 装了Skill:桥面控住,两边就是纯粹的云海。
原因在于视觉导演自己写了一条硬规矩——"桥边不许加栏杆"。这条规则约束了模型的默认倾向,让画面更有留白与意境。
这背后有一个有趣的技术现象:AI绘画模型在训练过程中学习了海量的"桥"的图片数据,其中绝大多数桥都带有栏杆,因此模型在生成"桥"这一概念时,会以高概率附带栏杆元素。这就是所谓的"数据先验偏差"——模型倾向于生成训练数据中的高频模式。Skill通过负面约束强行抑制了这种统计倾向,从而实现超越"平均水平"的艺术表达。

差异二:人物比例的精准控制
- 没装Skill:人物目测占了画面的四分之一,喧宾夺主;
- 装了Skill:人只是桥中央的一个小点。
同一份规则里明确写了:这一轮把人物锁定到"画面高度的3%",因为"门才是主角"。哪怕只给一句"太帅了"的反馈,Skill也能维持这个比例约束。
说个细节,三家Agent里,只有Codex真正把人物缩到了那个3%的比例。这再次印证了前面的判断:Skill提供的是规则和意图,但能否精准执行,取决于Agent本身的能力上限。
结论:Skill是导演,Agent是画师
这次测试清晰地揭示了当前AI生成工具的一个演进方向——能力的解耦。
Skill(如"东方仙侠视觉导演")扮演的是"导演"角色,负责把模糊需求转化为精确的视觉规范、负面约束和构图比例;而Agent(Codex/WorkBody/Grog)扮演的是"画师",负责理解并执行这些规范。
能力解耦(Decoupling)是当前AI工具链演进的核心趋势之一,其思想直接借鉴了微服务架构的设计哲学。在传统的AI绘画工作流中,模型能力、提示词策略、后处理逻辑往往紧密耦合在同一个系统中,导致任何环节的升级都需要全链路调整。而"Skill+Agent"的分层架构将决策层(做什么)与执行层(怎么做)彻底分离:Skill可以在不同Agent之间迁移复用,Agent也可以搭载不同领域的Skill来扩展能力边界。这种模式与操作系统中"驱动程序+硬件"的关系高度类似,预示着AI生态可能走向类似App Store的分发模式——未来用户选择的不只是哪个AI模型,更是搭配哪些Skill来构建自己的专属创作工作流。
对普通用户而言,这意味着AI绘画门槛的大幅降低:不需要成为提示词工程专家,只要一句大白话加一个合适的Skill,就能稳定产出高质量作品。而对开发者而言,构建可复用的"视觉导演"式Skill,可能是比训练大模型更务实的差异化路径。
如果你也想试试,云海仙山还是宫门主题,都可以从一句大白话开始。
相关推荐

机器学习研究入门:必读论文清单与研究实习申请路径
为ML初学者整理从零到研究实习的完整路径,包括必读经典论文清单(AlexNet、ResNet、Transformer等)、论文阅读方法、复现技巧及研究实习申请的实用建议。

Claude Code 入门实战教程:安装配置到自动化开发完整指南
详解Claude Code从环境搭建、权限配置、Go目标自主循环、Skills技能系统、MCP协议集成到版本控制的完整开发流程,帮助开发者快速掌握AI编程自动化工具。

Gemini 3.7 Flash发布与GPT-5.6极速模式:AI开源迈向生态时代
谷歌发布Gemini 3.7 Flash专注编程与Agent优化,OpenAI推出GPT-5.6 Ultra-Fast模式实现14倍速度提升。AI开源从开放模型转向开放生态,Agent工具链与成本监控工具密集涌现,智能体工作流进入实用化阶段。