女儿在抖音刷到"会动的故事"
我花2小时搭了一条漫剧生产线
靠谱瓦叔 | 2026年5月
文字有一种神奇的力量——当孩子指着书里的插画问"她为什么会在这里",你就知道这个故事已经钻进了她的小脑袋。但如果能让画面动起来呢?如果她从"看故事"变成"看动画"呢?
我女儿最近在抖音上刷到了一些"会动的故事"——儿童文学作品被做成短视频,有的简单到只是一张图配一段语音,然后机械地翻页;复杂一点的会有简单的动画效果,但前后镜头的衔接往往很生硬,角色画风也忽左忽右。

但她看得津津有味。
然后她抬头问我:"爸爸,能不能把儿童文学变成动画……做成一个工作流的那种?"
01
PHASE ONE/ 女儿的一句话,让这件事值得做
那天她窝在沙发里刷抖音,手机里传来朗读童话的声音。我凑过去看——屏幕上是童话文学里的一页插画,画面静止不动,只有配音在读旁白。几秒后切到下一页,还是静态插画,只是画面元素稍微换了位置。

翻了几条之后,她点开一个"进阶版":主角有一个简单的走路动画,但背景完全没变,树和草像贴纸一样钉在原地,角色的脚像在冰面上滑。更离谱的是,下一个镜头里,主角的衣服颜色从蓝色变成了紫色——显然是用了两套完全不相关的素材拼凑的。
但她还是看完了。看完之后不是"这个做得不好",而是"这个好好玩,我们能不能也做?"
这就是孩子看世界的方式。她不关心技术实现,不关心画面是否完美,她只关心一件事:这个故事能不能动起来?
而对于我来说,她的这个问题其实包含了一个更专业的追问:能不能把"儿童故事→动画短片"变成一个标准化的生产流程?
不是做"一个"动画,而是做"一条"生产线——以后任何故事扔进去,都能产出结构完整的漫剧。
02
PHASE TWO/ 没有管线的时候,做漫剧是"手工作坊"
说实话,在此之前我零星试过几次。拿一个童话故事,写一段即梦AI提示词,生成一张图——很漂亮。但问题在于:只有一张。

要从一张图变成一个拥有12个面板的完整漫剧,中间需要解决的问题一个比一个扎心:
问题清单
角色一致性:同一个主角在12个镜头里必须长得一样。但每次写提示词都是从零开始描述,到第5个镜头时已经不记得第1个用了什么措辞
场景一致性:森林在第3个镜头的色调和第7个镜头完全不同——因为两次用的场景描述词不一样
分镜节奏:一个面板是3秒还是8秒?全靠感觉。做出来要么像幻灯片翻太快,要么像慢动作拖沓
提示词复用:每个面板都要写两条提示词——起始帧和结束帧。12个面板就是24条提示词,如果每条都从头写,不疯也得秃
最要命的是:改一个角色的发型,24条提示词全部要手动改。
这条生产线的核心思路其实很简单——把一次性的"手艺"拆成可复用的"零件"。
03
PHASE THREE/ 六步标准化:把"一次创作"变成"可持续生产"
整条管线一共六步。每一步的输出,是下一步的输入。核心设计只有两个字:锁定。
六步管线总览
Step 1 文本解析 → 把故事拆成节拍表(每个情节一个节拍)
Step 2 角色设定 → 为每个角色创建"种子词"(40字以内,锁定外形)
Step 3 场景设定 → 为每个场景创建"氛围种子词"(锁定色调光线)
Step 4 分镜剧本 → 逐面板分镜表(构图+对白+情绪弧+时长)
Step 5 生图提示词 → 每个面板的起始帧+结束帧提示词
Step 6 视频脚本 → 生成模式+帧间动画+转场+配音+BGM
锁定是这篇文章最重要的一条设计原则。
Step 2 角色设定这一步是整个管线质量的基石。每一个角色都要产出一段不超过40字的"生图种子词",比如:
Q版小女孩,3头身圆润体型,乌黑齐肩短发,红色蝴蝶结发箍,蓝色泡泡袖上衣搭配黄色蓬蓬裙,白色领口,裙摆小雏菊刺绣,大眼睛圆脸蛋,表情天真可爱
这段种子词在 Step 5 生成所有面板提示词时,会被原封不动地粘贴进每一条提示词。不是"类似",不是"差不多",而是字面上一模一样。这就是锁定的力量——12个面板里,主角永远是同一个人。
同理,Step 3 场景设定产出的"氛围种子词"也会被锁定复用。同一个森林场景的所有面板,光线、色调、标志元素完全一致。
还有一个设计值得单独说一下:Step 4 的强制暂停机制。
分镜剧本是整个管线里最容易被忽视但改动成本最高的环节。如果分镜确认之后再大改——比如把一个面板拆成两个,或者调换镜头顺序——那么 Step 5 所有写好的提示词都得重来。所以在 Step 4 完成之后,流程会强制暂停,要求确认面板数量、构图、节奏后再继续。
这个机制看起来"多了一步",但它把后期返工的概率从"大概率"压到了"接近零"。
04
PHASE FOUR/ 一个实例:12个面板的童话拿下
说再多不如跑一个实例。我们以一个经典童话《白雪公主》为例——注意,受版权保护,生图、做视频的时候不能直接提这个名字。
我来描述她:一个穿蓝色连衣裙、系红色蝴蝶结发箍的小姑娘,被坏人嫉妒,逃入森林,遇到了七个善良的小伙伴,最后在美丽的山顶上醒过来。
这个故事跑完管线之后,产出了:
产出数据
12 个分镜面板
8 个角色(含两种形态的坏人)
5 个场景
24 条即梦AI生图提示词
预估82秒总时长
8个面板使用首尾帧模式,4个面板使用多参考图模式
最关键的不是数量,是这些数字之间的咬合关系。




每一个面板的提示词都不是孤立的。以其中一个面板为例——小姑娘在森林里迷路,发现了一间小木屋。这条提示词的关键元素来自三个地方:
一条提示词的三段来源
角色种子词(Step 2):Q版小女孩,3头身圆润体型……蓝色泡泡袖上衣搭配黄色蓬蓬裙……
场景种子词(Step 3):茂密森林小路,高大树木枝叶交错,斑驳阳光穿过树冠洒在地面……
当前面板描述(Step 4):女孩奔跑中回头张望,表情紧张,远处树丛间露出小木屋的一角
三段拼在一起,就是一条完整的即梦AI提示词。角色不变,场景不变,只是表情和位置在变——这就是12个面板视觉统一的原因。
05
PHASE FIVE/ 下一步:连上即梦CLI,一键出片
现在管线产出了24条结构化提示词——每条都有角色种子词、场景种子词、起始帧描述、结束帧描述、帧间动作描述。
下一步是让这24条提示词自动化地跑起来。
目前的状态是:提示词是写好了,但需要手动打开即梦AI,一条一条粘贴,等生成,下载,再粘贴下一条。24条跑完,再加上后期的视频合成,至少半天。
但如果接上即梦CLI(或者可灵CLI):
自动化流程
① 把24条提示词做成一个批处理队列
② CLI自动逐条推送到即梦API,起始帧和结束帧成对上传
③ 帧间动作描述自动填入"图生视频"参数
④ 生成完毕后自动下载 + 按面板编号重命名
从"手动操作24次"到"回车一下等出片"。
这不是一个"未来的设想"。我们今天就在做这件事——把管线产出的结构化数据,直接对接到即梦CLI的命令行接口。
三阶段流程
⚙️ 批处理队列:24条提示词 + 参数,CLI逐条执行
🎬 帧间动画:起始帧→结束帧,即梦自动生成中间过渡
🎥 最终合成:12个视频片段 + 旁白配音 + BGM → 一条完整漫剧
对于家长来说,这个流程最大的意义不是效率,是可能性——孩子选一个故事,你跑一条管线,几个小时后,一个属于你们自己的动画短片就诞生了。
06
PHASE SIX/ 不止这一个故事
这条管线不是为某一个童话定制的。任何儿童文学作品——绘本、童话、寓言、民间故事、甚至孩子自己编的小故事——都可以走通这六步。

管线在设计上支持两个参数的自由组合:
以及8种儿童友好画风可选:日系绘本水彩风、欧美绘本风、中国风水墨彩墨、迪士尼3D卡通风、扁平矢量风、手绘蜡笔/彩铅风、日系赛璐璐动漫风、剪纸拼贴风。
最让我觉得有意思的组合:幼儿版 × 手绘蜡笔风。蜡笔的质感有一种天然的"不完美感",和孩子画画的笔触很像,反而比精致的3D渲染更有温度。
所以回来看最初那个画面——女儿窝在沙发里刷抖音,抬头问了一个问题。那句话不是什么"创业灵感"或者"产品需求",就是一个孩子觉得好玩、想让更多故事也动起来的本能冲动。
我能做的,就是帮她把这个冲动变成一条能反复跑的生产线。
这条线跑起来的那一刻,她看到的东西就不再是别人做好的视频了——是她自己选的故事,她自己的动画。
—— 靠谱瓦叔,2026年5月
— END —
如果你也在探索 AI 育儿的新玩法
欢迎点赞 / 在看 / 转发,让更多家长一起玩起来 🚀
点赞
收藏
分享
THANKS FOR READING







