JOTO
Contact us
← AI 智库
多模态模型

AI改图,终于懂点「用户心理学」了

2026 年 9 月 28 日

快手技术团队推出电商图像编辑基座模型KwaiMind,融合通用编辑与电商专项能力,在Ecom-Bench评测中视觉总分位居开源模型第一;线上A/B实验显示其带来商品主图点击率相对提升约2.44%。模型采用多智能体数据引擎构建180万对高质量训练样本,并通过专项优化与多教师蒸馏(DiffusionOPD)统一基座能力。

电商图像编辑的新基座

一张电商图片,既要准确展示商品,也要契合用户喜好,更承载着价值转化的商业期待。当图像编辑开始读懂用户偏好,模型能否将不同的创作意图转化为合心意、可使用的电商素材,进一步激发商业价值潜能?

快手技术团队推出 KwaiMind,一套面向真实电商内容生产的图像编辑基座模型。融合通用图像编辑与电商专项能力,在保留商品细节、准确呈现文字的同时,满足多样化创作需求,并配套构建电商任务评测体系,形成从数据生产、模型训练到效果评估与业务反馈的完整闭环。

据技术报告披露,KwaiMind 在多项通用图像编辑基准上取得参评开源模型综合得分第一;在自建电商评测 Ecom-Bench 中,视觉总分位居参评开源模型第一。线上商品主图素材优选 A/B 实验中,KwaiMind 带来实际点击率相对提升约 2.44%,展现了电商图像编辑的商业应用潜力。

Ecom-Bench 视觉总分与 Ecom-CTR 排名比较图表
图 1   Ecom-Bench 视觉总分与 Ecom-CTR 排名比较。CTR 为预测排名累计计数。

从通用编辑到定向修复

KwaiMind 将增删、替换、构图调整和局部问题修复纳入同一套指令式编辑能力,支持服装试穿、商品细节展示、配饰佩戴、背景替换、动作调整等任务。商家可以围绕已有素材提出展示需求,也可以针对文字、背景等局部问题进行定向修改。

KwaiMind 编辑案例,涵盖服装、配饰、商品场景和通用图像编辑
图 2  KwaiMind 编辑案例,涵盖服装、配饰、商品场景和通用图像编辑。

以电商卖点图为例,模型需要根据商品图与编辑指令调整背景和构图并进行文字的渲染,在突出商品视觉表现的同时,保持其外观、材质与关键细节的一致性。这些要求也考验模型的通用编辑能力。KwaiMind 在适配电商场景的同时,也展现出较强的通用编辑能力,在多个通用基准测试中均优于本报告中其他参评的开源模型。

KwaiMind 在四组通用编辑评测中均取得参评开源组最高总体得分
图 3 KwaiMind 在四组通用编辑评测中均取得参评开源组最高总体得分。

四项智能体协作维护高质量训练数据

电商素材规模庞大、来源多样,既需保障质量,也需适配不同任务。传统流程依赖反复筛选、修改和复核,成本高、效率低,标准也难统一。为此,KwaiMind 构建了多智能体数据引擎,将质量过滤、样本修复、定向补充与指令标注整合为统一流程,实现任务自动流转、样本状态可追踪。四类智能体分工如下:

  • Filter Agent:预筛输入图像,复筛编辑结果;
  • Generation Agent:根据诊断修复可恢复样本,补充覆盖不足的任务数据;
  • Caption Agent:生成不同粒度的编辑指令;
  • Coordinator Agent:维护样本状态与分布,统筹任务调度、流程衔接及重试。

系统同时引入Human-in-the-Loop机制,将低置信、高分歧样本交由人工审核,审核结果回流数据生产流程,兼顾处理效率与数据质量。

精选 SFT 数据的任务构成及代表性样本
图 4  精选 SFT 数据的任务构成及代表性样本。

多智能体数据引擎从约 2,620 万对候选数据中构建并维护约 180 万对高质量训练样本,供 Continued Fine-tuning 阶段使用。进一步精选约 23.49 万对数据用于 SFT 阶段,包括 11.5 万对通用编辑样本和 11.99 万对电商样本。通用数据夯实模型的基础编辑能力,电商数据则围绕服装细节、商品展示和文字编辑等强化专项能力,共同提升模型的指令遵循度与图像美观度。

专项优化与多教师蒸馏整合为统一基座

真实电商任务往往要求模型同时做好多件事:执行编辑指令、保留商品细节、写对文字,并生成更能吸引用户关注的画面。这些目标的优化难度和收敛节奏并不相同,直接混合训练可能产生干扰,依次优化又可能遗忘已有能力。

KwaiMind 为此采用了一套结合专项能力优化与多教师蒸馏的训练方案:在通用编辑能力之上,模型进一步强化视觉质量、商品一致性、文字准确性以及商业点击吸引力。再通过 DiffusionOPD 将不同专家的能力汇聚到统一模型。

训练框架与 DiffusionOPD 多教师蒸馏示意图
图 5  训练框架与 DiffusionOPD 多教师蒸馏。专项教师在学生自身的去噪轨迹上提供指导。

DiffusionOPD 是一种在线蒸馏策略,由教师沿学生的去噪轨迹逐步指导,使能力迁移更贴近学生实际的生成过程。KwaiMind 将通用编辑、文字处理、商品细节保留与用户偏好整合到同一模型中,让一次编辑兼顾多项要求,例如更换背景时保留包装细节与文字,同时生成更符合用户偏好的展示效果。

Ecom-Bench:系统定义电商任务与评测体系

电商图像编辑需要明确的任务边界,也需要一套能够判断素材是否可用的评价标准。

为此,团队构建Ecom-Bench,包含 11 项任务、1,100 个案例,每项任务 100 个案例。这些任务包含了虚拟试穿、服装细节、姿态调整等模特穿戴任务,背景替换、商品提取、卖点展示等海报相关任务,以及文字编辑、宣传语去除等文字任务。

围绕这些任务,Ecom-Bench 建立了由6 个通用维度和 8 个电商专项维度组成的综合评价体系:

  • 通用维度关注指令遵循、融合自然度、物理与光照合理性、非编辑区域保留、图像质量及整体美感;
  • 电商维度关注检查商品身份、文字准确性、面料纹理、模特与姿态、服装合身度、抠图边缘、卖点传达及商品展示完整性。

每项任务选取 2 个通用维度和 2 个电商维度,按任务需求确定评价重点。下表是具体的任务测评维度分配:

Ecom-Bench 各任务的评价维度分配表
表 1  Ecom-Bench 各任务的评价维度分配(对应技术报告 Table 5)

评分时,评审模型会结合参考图、编辑指令和生成结果,按照明确的评分标准,对四个维度分别给出 1-5 的整数分。

Ecom-Bench 综合评分公式示意
图 4  Ecom-Bench 综合评分公式示意

单个案例的综合分采用几何平均计算,使文字出错、商品身份偏移等关键缺陷更明显地影响综合得分,降低单项高分所掩盖的素材可用性问题。各任务得分为该任务 100 个案例综合分的平均值,总分再对 11 项任务等权平均。

如图 1 所示,在报告的评测设置及参评模型范围内,KwaiMind 的 Ecom-Bench 视觉总分位居开源模型第一。除了视觉质量,团队还通过 Ecom-CTR 评估生成素材的预测点击偏好。不同模型的输出进行排序,各模型进入前三名的次数累计为 CTR 分数,以衡量相对商业吸引力。KwaiMind 在这一指标上表现优越,体现了模型对素材可用性与用户偏好的兼顾。

下面是一些可视化对比素材,覆盖卖点展示、服装细节、服装展示和虚拟试穿。结合参考图与编辑指令,可以直观看到不同模型在商品素材生成方面的差异。

服装展示编辑效果对比
图 6  服装展示
服装细节编辑效果对比
图 7  服装细节图
卖点图编辑效果对比
图 8  卖点图
虚拟试穿编辑效果对比
图 9 虚拟试穿

业务验证:素材生成到真实点击提升

为了验证 KwaiMind 在实际业务里的应用价值,团队启动了商品主图素材优选线上 A/B 实验。在实验中, KwaiMind 带来了约 2.44% 的实际点击率的相对提升。

在离线评估中,对于随机质量采样的商品图,KwaiMind 生成图的预估 CTR 高于原始商品图的比例,由训练前的 12.16% 提升至 37.41%;相较于未经优化的基线生成图,其预估 CTR 胜率达到 91.89%。

AI改图,终于懂点「用户心理学」了 配图 12

JOTO 企业落地观察

  • 电商图像编辑模型若要真正嵌入企业内容生产管线,必须解决“可用性”与“可控性”的双重门槛:Ecom-Bench 所定义的多维评价体系,为企业 AI 图像工程提供了可量化的验收标尺,而非仅依赖主观审美或模糊的“效果更好”表述。
  • 多智能体数据引擎+Human-in-the-loop 的设计,揭示了高质量垂域数据生产的典型范式——它不追求纯自动化,而是将人工审核作为闭环中的关键校准节点。这对企业构建自有RAG知识库或微调数据集具有直接参考价值:人机协同的数据治理流程比全自动化更稳健。
  • KwaiMind 将商品一致性、文字准确性、用户偏好等目标通过多教师蒸馏统一到单基座,意味着企业无需为不同子任务部署多个专用模型。这对降低智能体工程中的模型运维复杂度、减少GPU资源碎片化有实质性意义。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.