产品简介
Ming-Image-0.1-Design 是蚂蚁百灵于 2026 年 9 月 23 日开源的视觉设计模型系列,包含两个 6B 参数模型,分别面向端到端设计生成与可编辑图层分解。该系列以结构化提示词控制、原生 RGBA 透明通道生成和语义化图层输出为核心特色,同步开源两个 Agent Skill,覆盖从提示词到代码验证、从截图到可编辑 PPT 的完整工作流。代码托管于 GitHub,模型权重在 ModelScope 与 Hugging Face 提供,另有 ComfyUI 适配,并在 OpenRouter 开放为期两周的免费 API 调用。
核心功能
- 双 6B 模型分工协作:Ming-Image-0.1-Design 负责文生设计,Ming-Image-0.1-Design-Layer 负责图层分解,两个 6B 参数模型分别覆盖设计生成与设计资产结构化两个环节。
- 细粒度结构化控制:支持输入最长 8K token 的结构化提示词,可对布局、排版、配色和图像引用进行细粒度控制,端到端一次生成 UI、仪表板、信息图、海报等完整视觉设计,配色、构图和素材风格统一。
- 原生 RGBA 透明通道生成:引入原生 RGBA VAE,可直接生成带透明通道的人物、商品、图标、装饰等素材,无需后期抠图。
- 语义化图层分解:输入任意扁平化的设计图像,输出 2 到 9 个语义化的 RGBA 图层(如标题、卡片、主体、背景),每层可独立移动、替换和重新着色。
- 开源 Agent Skill 工作流:同步开源 Ling UI Design Skill 与 Image-to-Editable-PPT Skill,前者实现从提示词或截图到设计、资产、代码再到浏览器验证的全链路视觉编码工作流,后者把幻灯片截图转成原生可编辑的 PowerPoint 文件。
适合谁用
以下类型的用户会特别受益于 Ming-Image-0.1-Design:
- 快速生成 UI 界面、仪表板、信息图与海报等完整视觉设计稿
- 直接产出带透明通道的人物、商品、图标与装饰素材,省去抠图环节
- 将扁平化设计图分解为可独立编辑的语义化图层,便于二次修改
- 把幻灯片截图转换为文本、形状、颜色和布局均可修改的原生 PowerPoint 文件
- 通过 Ling UI Design Skill 完成从提示词或截图到设计、资产、代码及浏览器验证的全链路工作流
优点亮点
- 在 Artificial Analysis 2026 年 9 月 18 日更新的 UI/UX Design 专项评测中位列开源模型第一,Elo 得分 1082
- 版式胜率 67.4%、复杂构图 67.0%、文字渲染 66.7%,多项细分指标表现突出
- 图层分解在 Crello 测试集全部 12 项评估中取得最优结果,比 20B 的 Qwen 基线快 4.3 倍
- 原生 RGBA VAE 支持直接生成透明通道素材,减少后期处理步骤
- 代码、模型权重与 ComfyUI 适配同步开放,并在 OpenRouter 提供为期两周的免费 API 调用
价格与方案
官方未公布具体定价信息,模型权重在 ModelScope 与 Hugging Face 提供,代码在 GitHub 开源,另有 ComfyUI 适配,并在 OpenRouter 开放为期两周的免费 API 调用;后续商用或 API 计费方式以官网为准。
总结与建议
Ming-Image-0.1-Design 以两个 6B 模型分别覆盖设计生成与图层分解,凭借结构化提示词控制、原生 RGBA 透明通道生成和语义化图层输出,在开源 UI/UX 设计评测中位列第一,图层分解在 Crello 测试集 12 项评估中取得最优结果。官方也说明其在复杂人手动作、连续操作步骤、精细阴影与反光等场景下输出稳定性仍不足,图层分解在大量叠加光效、特殊透明材质和复杂遮挡时可能出现边缘残留或图层缺失。
版本演进
- 蚂蚁百灵开源 Ming-Image-0.1-Design 系列 (2026-09-23):两个 6B 模型:Design 从最长 8K token 的结构化提示词端到端生成 UI、信息图与海报并支持原生透明通道;Layer 把扁平设计图拆成 2 到 9 个可独立编辑的 RGBA 图层。同步开源 Ling UI Design Skill 与 Image-to-Editable-PPT Skill。