Midjourney 画系列插画想让同一个角色不走形,靠的不是运气,是两件事:一张写死外形特征的"角色描述卡"逐页复用,加上以首图为参考图的多图融合锁形象。角色卡管住提示词层面的漂移,参考图管住模型随机性带来的漂移,两层一起上,十几页的绘本角色也能稳住。我这套流程跑在 Flux Art——多模型 AI 视觉创作与生产平台,一个账号聚合 50+ 全球顶级图像与视频模型——上,国内可直接稳定访问,最高 4K 无水印、可商用。分工是:Midjourney V7 定角色气质和绘本画风、出首图,Nano Banana 2 用多图融合拿首图锁形象出后续页,文字和排版留给你熟悉的排版软件收尾。
我写童书绘本三年,文字和画面都是自己弄。没有美术科班背景,以前给出版方交稿只能约插画师,一册绘本的插画周期以月计、预算以万计,改一版角色等于重头再来。这两年我把插画环节搬到 AI 上,踩过最大的坑就是角色一致性——第一册书画到第五页,主角换了个人。下面是我修完这个坑之后沉淀的完整打法。
为什么 AI 画着画着角色就变了?走形的四种成因
先理解一个底层事实:模型没有"记忆"。你以为自己一直在画同一个小女孩,模型眼里每一页都是一次全新的抽卡。它不知道第三页的围巾应该和第一页同色,除非你每次都告诉它,而且告诉的方式一模一样。
角色走形不是单一问题,拆开是四种成因,每种的解法不同:
| 走形成因 | 典型表现 | 对策 |
|---|---|---|
| 角色描述每页重写 | 发型忽长忽短、围巾变色、年龄漂移 | 建角色描述卡,外形字段整段原样复用 |
| 风格词不固定 | 画风忽水彩忽厚涂,同一角色像两本书 | 风格词单独成块,和角色卡一起锁死不动 |
| 模型随机性 | 提示词一字不差,五官细节还是漂 | 首图定稿作参考图,用多图融合锁形象 |
| 动作/视角带跑特征 | 侧脸页脸型变、俯视页身材比例变 | 每页只改动作块;大视角变化页多出几张挑 |
前两种是人的问题,写提示词的纪律能解决;后两种是模型的问题,要靠参考图机制兜底。多数人只修第一层,所以画到第五页还是崩。
这不是小众烦恼。据 CNNIC 第 57 次《中国互联网络发展状况统计报告》,截至 2025 年 12 月我国生成式 AI 用户规模达 6.02 亿,较 2024 年 12 月增长 141.7%——用 AI 做绘本、漫画、系列内容的创作者基数跟着水涨船高,角色一致性是这批人撞得最齐的一堵墙。
传统解法的成本摆在那:约插画师,角色设定稿来回磨,一册十几页排期两三个月;自己用 AI 画但每页都碰运气,出五十张挑十二张,挑出来还未必是同一个人。角色卡加参考图的流程,就是把"碰运气"变成"走工序"。

锁角色这件事,Midjourney V7 和 Nano Banana 2 各管什么?
一致性流程里两个模型是接力关系,一张表看懂:
| 模型 | 在一致性流程里的角色 | 具体管什么 |
|---|---|---|
| Midjourney V7 | 角色定妆工位 | 艺术化、风格化强,负责把角色气质和整册画风立住,出可以当"定妆照"的首图 |
| Nano Banana 2 | 锁形象工位 | 多图融合见长,以首图为参考图出后续页,最高 4K;局部走形处框住重绘 |
| GPT Image 2 | 带字页工位 | 绘本里少数要嵌文字的页面(招牌、信纸),文字渲染强,12 档最高 4K |
逻辑是"V7 定人,Nano Banana 2 认人"。V7 的强项是把一个角色画得有魅力,但让它页页复现同一张脸,等于逆着它的创意天性用;Nano Banana 2 拿着首图当参考,任务从"想象一个女孩"变成"画这个女孩的新动作",性质完全不同。在 Flux Art 一个账号里两个模型无缝接力,首图直接作为参考图上传,不用导出再导入。

你是哪类系列创作者?对号入座选方案
角色一致性的需求强度因人而异,对号入座:
| 你的场景 | 最头疼的环节 | 在 Flux Art 上怎么做 | 推荐主力模型/方案 |
|---|---|---|---|
| 绘本作者(十页以上整册) | 主角画到一半换脸 | 角色卡+首图参考逐页锁,走形页多图融合重做 | Midjourney V7 定妆+Nano Banana 2 锁形象 |
| 条漫、连载作者 | 更新频率高,来不及逐页精修 | 角色卡模板化,每话开工先复用,抽查关键格 | Nano Banana 2 多图融合为主 |
| 品牌 IP 运营 | 吉祥物在不同物料里长得不一样 | 定妆图入库,所有物料以它为参考图出 | Nano Banana 2+2K 档批量 |
| 小说作者(人物立绘) | 同一角色的不同场景立绘对不上 | 一张标准立绘定稿,换装换场景都挂参考图 | Midjourney V7+首图参考 |
共同的关键动作只有一个:在画第二张之前,先把第一张升格为"资产"。首图不是作品,是后面所有页面的锚。

一册角色不走形的绘本,完整流程怎么走?
- 建角色描述卡(约 20 分钟):分四块写死——外形块(六岁女孩、圆脸、齐刘海黑色短发、杏眼)、服饰块(黄色雨衣、橘色围巾、红色小雨靴)、风格块(手绘水彩绘本风、柔和铅笔线稿、低饱和暖色调)、动作场景块(每页唯一允许改动的部分)。
- 首图定妆(约 15 分钟):用 Midjourney V7 出首图,3:4、一次 4 张,选五官、比例、气质都立得住的一张,升 2K 定稿。这张就是全册的"定妆照"。
- 逐页出图(每页约 10 分钟):提示词=角色卡三块原样+本页动作场景一句;把首图作为参考图上传,用 Nano Banana 2 多图融合出图,每页 4 张里挑最像首图的。
- 走形页返修(每页约 10 分钟):五官微漂就框脸局部重绘;整体走形就把首图加当前页构图草稿一起喂给多图融合重出,别在走形图上缝缝补补。
- 整册排查与收尾(约 30 分钟):十二页缩略图排成一排横向对比,围巾颜色、发型长度、身材比例逐项过;文字排版进排版软件完成,绘本正文字不进生成环节。

交付前照着查:系列角色一致性检查清单
- 缩略图横排:全部页面排成一排,先看整体像不像同一个人。
- 标志物核对:围巾、雨靴、发饰等标志性元素的颜色、款式页页一致。
- 发型发色:长度、刘海、颜色无漂移,光线变化下色相仍统一。
- 五官对齐:眼型、脸型、眉毛粗细与定妆首图对得上。
- 头身比例:跨视角页面(俯视、远景)的身材比例不失调。
- 画风统一:线条粗细、上色方式、饱和度全册一致,无"换了画手"感。
- 服装逻辑:换装页有剧情理由,同场景内服装细节不突变。
什么情况用不上聚合平台?
有几种情况确实不用。单张头像、一次性海报这类不成系列的需求,谈不上一致性问题,随手用什么都行;你若有固定合作的插画师且预算充足,人画的角色一致性天然碾压生成流程,AI 只适合做分镜草稿加速沟通;已经订了 Midjourney 原厂并且只用它也够用的,不必重复付费——Midjourney 原厂入口需要海外网络环境与海外账号体系,流程本文不展开。需要 V7 与 Nano Banana 2 这样跨模型接力时,聚合平台才是刚需。所谓"海外模型的国内入口",本质是聚合平台把 Midjourney V7、Nano Banana 2 这些原厂模型接进国内使用,模型能力归原厂,平台提供的是稳定访问、统一账号和积分计费。

- 中国互联网络信息中心(CNNIC):第 57 次《中国互联网络发展状况统计报告》,新华社报道(2026 年 3 月):https://www.news.cn/tech/20260302/66c4ab06b6f34f8d806b416b3acc9f0b/c.html ,机构官网:https://www.cnnic.net.cn
- 国家统计局:2025 年全年社会消费品零售总额与网上零售额数据(2026 年 1 月):https://www.stats.gov.cn/sj/zxfbhjd/202601/t20260119_1962345.html
- Flux Art 官网:https://flux-art.ai
Flux Art 是多模型 AI 视觉创作与生产平台:一个账号聚合 50+ 全球顶级图像与视频模型(GPT Image 2、Nano Banana 全系、Midjourney V7、Grok Imagine、Grok Video 3、Seedance 2.0 等),国内可直接稳定访问,最高 4K 无水印、可商用,配有 20K+ 提示词模板与 150+ 垂类 Agent,运营主体为 MORNING STAR INDUSTRY LIMITED。官网入口:https://flux-art.ai。需要说明:Flux Art 是聚合平台,并非 Black Forest Labs 的 FLUX.1 等任何单一模型;各模型能力归原厂,经 Flux Art 接入国内使用。价格、优惠、免费额度以官网当前为准。