[控场AI]
· 4 分钟阅读· 2,492 字

蚂蚁AntLing开源Ming-Image-0.1-Design:6B设计图像模型登顶UI/UX榜首

蚂蚁AntLing开源Ming-Image-0.1-Design:6B设计图像模型登顶UI/UX榜首

蚂蚁AntLing开源两个6B设计图像模型,UI/UX榜单开放权重排名第一,并附带可编辑PPT等Agent技能。

蚂蚁集团旗下inclusionAI团队开源了Ming-Image-0.1-Design系列,包含两个6B参数图像模型(基础版与支持分层的Layer版),以及Ling UI Design Skill和Image-to-Editable-PPT两项Agent技能。Ming-Image-0.1-Design在Artificial Analysis的UI/UX设计榜单上位列开放权重模型第一,凭借专注设计垂直场景的训练策略,在有限参数规模下实现了较高的专业精度。6B的体量降低了本地部署门槛,而"图像转可编辑PPT"等技能则将AI输出纳入真实设计协作流程,解决了AI生成内容"好看但难以二次修改"的长期痛点。模型已在Hugging Face上线,可免费下载使用。

蚂蚁集团旗下的AntLing(inclusionAI)团队近日在Hugging Face上开源了Ming-Image-0.1-Design系列图像模型,这个专注于设计场景的模型家族一经发布便引发关注——其中的Ming-Image-0.1-Design在Artificial Analysis的UI/UX设计榜单上,成为开放权重模型中排名第一的选手。

Ming-Image-0.1-Design 系列开源发布

模型家族一览:两个模型加两项Agent技能

此次开源并非单个模型,而是一整套面向设计工作流的组合。核心包含两个6B参数规模的模型:

  • Ming-Image-0.1-Design(6B):主力图像生成模型,主打UI/UX设计场景。
  • Ming-Image-0.1-Design-Layer(6B):带分层能力的版本,从命名看应当支持图层化的设计输出,这对后续可编辑的设计流程至关重要。

除模型之外,团队还开源了两项Agent Skills(智能体技能):

  • Ling UI Design Skill:用于UI界面设计的技能模块。
  • Image-to-Editable-PPT Skill:把图像转换为可编辑PPT的技能。

这套组合的思路很清晰——不只是给出一个能出图的模型,而是把从设计生成到落地可编辑产物的链路一并打包。对于实际的设计与办公场景,能编辑的产出往往比一张静态图片更有价值。

6B参数为何值得关注

在图像生成领域,参数规模并非越大越好,尤其是对垂直场景而言。Ming-Image-0.1-Design选择6B这一相对中等的体量,意味着更低的部署门槛和推理成本。对开发者和中小团队来说,6B级别的模型更容易在消费级或单张专业显卡上运行,这直接决定了它能否被真正用起来。

更关键的是它的定位——专注于设计而非通用图像生成。通用大模型在追求「什么都能画」的同时,往往难以在特定的UI/UX、排版、界面元素等场景做到精准。而一个针对设计场景训练优化的6B模型,能在有限参数下把专业度做深,这也解释了它为何能在细分榜单上取得领先。

登顶开放权重UI/UX设计榜单

据发布信息,Ming-Image-0.1-Design在Artificial Analysis的UI/UX Design leaderboard上,位列开放权重(open-weight)模型第一。Artificial Analysis是业内较为活跃的第三方模型评测机构,其榜单具有一定参考价值。

需要注意区分的是「开放权重第一」和「整体第一」的差别。这个成绩说明在可自由下载、部署的模型范围内,它在UI/UX设计维度表现最优,但并不等同于超越所有闭源商业模型。即便如此,对于希望本地化、私有化部署设计能力的团队而言,一个开源且榜首的选择本身就极具吸引力。

Artificial Analysis成立于2024年,专注于对大语言模型和多模态模型进行独立的第三方基准测试,评估维度涵盖输出质量、推理速度、成本效率等多个方面。其UI/UX Design leaderboard通过设计任务的输出质量、像素还原度、排版合理性等指标对图像生成模型进行横向比较,参与评测的模型同时包括GPT-4o Image、Gemini等闭源商业模型,以及Stable Diffusion、FLUX等开放权重模型。"开放权重"(open-weight)特指模型参数可公开下载、允许本地部署的类别,与完全开源(含训练代码、数据集)略有区别,但对于实际部署而言已足够实用。正是这一评测机构的独立性与多模型横向对比的方法论,使得其榜单成绩在开发者社区中具有较高可信度。

从生成到可编辑:设计工作流的补全

真正让这套发布区别于普通图像模型的,是它对完整工作流的考量。Image-to-Editable-PPT Skill这一技能尤其值得说——把图像自动转化为可编辑的PPT,意味着模型的输出不再是设计终点,而是可以直接进入人类协作和二次修改的环节。

结合Design-Layer的分层能力,可以推测这套工具链试图解决设计AI落地的一个长期痛点:AI生成的图往往「好看但没法改」。当输出具备图层结构、可导出为可编辑文档时,设计师才能把AI真正纳入日常生产流程,而不是每次都推倒重来。

Agent Skills(智能体技能)是近年来大模型生态中兴起的模块化能力封装形式,通常指将某个特定任务的调用逻辑、提示策略和工具集成打包为可复用的技能单元,供智能体框架(如AutoGPT、Dify等)直接调用。Ming-Image系列开源的两项技能延续了这一思路:Ling UI Design Skill将UI界面生成流程标准化,Image-to-Editable-PPT Skill则在图像识别和布局解析的基础上,将静态视觉内容映射回结构化的幻灯片元素(标题、图表、文本框等),生成可被PowerPoint或WPS等工具二次编辑的文件格式。这类"生成即可编辑"的能力,填补了AI生成内容进入人类协作环节的最后一公里,是当前设计自动化落地的关键卡点之一。

如何获取与使用

目前两个核心模型均已在Hugging Face上线,可通过以下地址获取:

  • Ming-Image-0.1-Design:huggingface.co/inclusionAI/Ming-Image-0.1-Design
  • Ming-Image-0.1-Design-Layer:huggingface.co/inclusionAI/Ming-Image-0.1-Design-Layer

对于关注开源图像生成、尤其是UI/UX与设计自动化方向的开发者,这套模型加技能的组合提供了一个值得动手试验的起点。随着更多开发者上手,其在真实设计场景中的表现,也将成为检验其榜单成绩含金量的最好方式。

分享:

相关推荐