提示词复制五遍,杯型还是会跑
做电商的人大多撞见过这种情况:同一只杯子放进五张主图,杯型出现三种——把手一会儿偏左一会儿偏右,釉色从奶白跑到灰蓝。把「奶白色陶瓷马克杯,C形把手,哑光釉面」这句话复制五遍,问题原封不动。
原因在生成机制。文生图每次都是从随机噪声开始采样,模型手里没有「上一张图」的记忆。你写「C形把手」,它每回理解的「C形」都差那么一点;写「奶白釉」,采样落到色域哪一格同样是随机的。提示词写长只能缩小范围,锁不住结果。
要让九张图里的商品是同一件东西,解决思路是让模型照着已有的图改,而不是每次从零生成。具体分两段:先做一张母图把商品外观定死,再借助参考图或指令编辑把它放进不同场景。
母图要拍得「无聊」
母图是整套流程的地基,它的干净程度决定后面九张图的上限。有实物的直接实拍,成本低且不会跑偏;没有实物(概念产品、虚拟形象)就用模型生成一张。
母图的几条硬要求:
- 单一商品,占画面 60%~70%
- 纯色背景,浅灰或白,不要有场景元素
- 一个角度就够,正面或 45°,光线均匀
- 除 logo 外不放任何装饰
用模型生成母图时,提示词按「主体 + 结构 + 材质 + 光」的顺序写,形容词堆叠帮不上忙:
一只哑光奶白色陶瓷马克杯,圆柱杯身,C形把手位于右侧,杯口平直,均匀柔和的正前方布光,浅灰色纯色背景
这个书写顺序建议固定下来,别每次换。生成系列图时,这句原样保留,只改后面的场景部分。
把母图「喂」进去的三种方式
参考图:门槛最低
即梦、可灵、通义万相这类国内工具的图生图或参考图入口,上传母图后通常有一个参考强度滑块,有的产品叫「相似度」,有的叫「图像权重」。这个参数是整条流程里最需要试的一个。
经验区间在 0.5~0.7。太高(0.85 以上)会把母图的背景和构图一起抄过来,想换的场景进不去;太低(0.3 以下)商品开始变形,母图等于白做。第一次用,固定一组种子跑 0.4 / 0.55 / 0.7 三档,挑出商品不变形、背景又确实换掉了的那一档,记下来当基线。
指令编辑:改一处不动其余
Flux.1 Kontext(dev 版开源)和 Qwen-Image-Edit 属于这一类,输入是「原图 + 一句指令」,输出只改指令涉及的区域。写指令时把边界也写进去:
把背景换成浅原木色桌面,保留杯子和它的釉面质感,不要改变杯型与把手位置
比「换个木质背景」这种短指令稳,因为模型知道哪些地方不许动。
ComfyUI:要批量就得走这条
一次出九张、还得保持同一组参数,手工点太慢。ComfyUI 里可以搭一条固定链路:加载母图 → 参考或编辑节点 → 采样 → 批量输出。Qwen-Image(阿里通义开源,20B)和 Flux Kontext 都有现成节点,前者中文文字渲染更稳,后者指令跟随更好。
本地跑 Qwen-Image 对显存有要求。20B 模型即使量化,12GB 显存也只是勉强,16GB 以上会舒服很多。显卡不够就退回网页端,只是批量慢一点。
中文字别交给图像模型写
商品图上要写「限时 88 折」「三年质保」这类文案,让图像模型直接生成中文,十张里能有一两张字形完全正确就算不错。Qwen-Image 在这件事上是国内目前表现较好的,但它也做不到 100% 笔画正确,小字号和生僻字尤其容易崩。
更实用的做法是分层:AI 只出无字底图,文字用排版工具叠上去。
这样做的直接好处是改文案不用重出图。今天写「买二送一」,明天改成「第二件半价」,在 Figma、稿定或 Canva 里改一个文本框就行,底图完全不用动。文字如果烧进了图片,每改一次都要重跑,商品还有可能再跑偏一回。
留白要在母图阶段就规划:出图时让主体偏左或偏下,给右上角留出干净空间,别指望后期硬挤。
批量出图的执行顺序
- 确认母图:商品无变形,背景无干扰元素
- 固定一组参数:参考强度、种子、采样步数,记在备忘录里
- 列场景清单:3 个场景 × 3 个角度,别边出边想
- 每个场景先出 1 张验证,确认商品没跑偏再批量
- 逐张核对:把手位置、logo 朝向、材质、比例
- 导出无字底图,统一命名(商品_场景_角度)
- 在排版工具里叠文字,另存一套带字版
两条路线怎么选
| 网页端工具路线 | ComfyUI 本地路线 | |
|---|---|---|
| 典型工具 | 即梦、可灵、通义万相 | ComfyUI + Qwen-Image / Flux Kontext |
| 上手时间 | 半小时左右 | 半天到一天 |
| 单张耗时 | 十几秒到一分钟 | 看显卡,几秒到几十秒 |
| 批量能力 | 手动逐张,或用画布的批量入口 | 一次提交几十张,参数完全一致 |
| 一致性 | 够用,参数靠手动记录 | 更稳,能存成工作流复用 |
| 硬件要求 | 无 | 建议 16GB 显存以上 |
| 费用 | 按积分计,有免费额度 | 电费加显卡成本 |
几个容易踩的坑
参考强度拉满求稳。 结果是九张图背景几乎一样,系列图做成复制粘贴。参考强度和背景多样性是互相拉扯的,得在 0.5~0.7 之间找平衡点。
重绘幅度开大想改干净。 商品边缘、logo、细纹理会跟着一起被重绘掉。改背景这类需求,重绘幅度往低了走,配合局部遮罩比全局重绘有效。
拿二次元模型做实物商品。 材质会明显发假,金属没有反射层次,布料看不到织纹。商品图用写实底模,别图省事混用。
忽略图片比例。 淘宝主图、小红书封面、抖音挂车的比例各不相同。母图阶段就按目标平台的比例来,后期裁切容易把主体切掉一块。
今天可以先做的一件事
翻出你手上出图最不稳的那款商品,拍一张或生成一张白底母图,用同一句提示词、固定种子,只改参考强度跑 0.4 / 0.55 / 0.7 三张。对比商品有没有变形、背景有没有换掉,把最合适的那一档数字记下来。
这个数字就是你后面所有系列图的基线。
补充学习
国内平台上能跟的几条线:
- B站 UP 主「秋葉aaaki」的 ComfyUI / Stable Diffusion 整合包系列,第一次装环境和节点比较省事,出处:bilibili
- 其余教程建议直接用关键词筛选,优先看近一个月发布、且视频里标注了模型版本号的:搜索「Qwen-Image ComfyUI 工作流」「Flux Kontext 指令改图」「即梦 参考图 一致性」,出处:bilibili