一份详细动漫提示词、一个只有一句话的对照提示词,以及两支可检查的 15 秒成片——都走同样的三步流程。
作者:Sonya,MkAnime 内容贡献者 · 发布于 2026 年 8 月 9 日
说明:我参与 MkAnime 的内容工作,并在这个项目中使用了 GPT Image2 to Video 流程。AI 协助整理和编辑了本文。两份提示词、生成的分镜、本地视频文件、公开的 YouTube 成片,以及当前产品流程,均已于 2026 年 8 月 8 日核对。
你有没有花掉一大笔视频积分,等了半天,却因为一个很小的镜头不满意?
开头可能不错,角色也对,最后的动作甚至很精彩。可某个机位、表情或转场偏离了预期,整段视频就很难再用。
这既费钱,也真的很闹心。
直接用提示词生成视频时,一次生成要同时处理角色设计、环境、镜头顺序、运镜、节奏、动作和连续性。只要其中一项走偏,你往往要等到最花积分的环节结束后才会发现。
这次 15 秒动漫实验里,我采用了更简单的三步流程:
1. 写清故事和画面限制
↓
2. 生成并检查一张宽屏分镜
↓
3. 将确认后的分镜做成 15 秒视频
这个方法不能保证第一支视频就完美。它提供了一个成本更低、心态更平稳的检查点,让我在画面动起来前先发现问题。

生成的分镜让我在视频生成前就能看到角色、世界、镜头顺序、运镜选择和情绪变化。
项目设定:两名玩家闯进一个不可能的方块世界
这个点子来自网上对一场创作者游戏马拉松的讨论。我不想复刻真人创作者、官方游戏素材、受保护角色、Logo 或界面,只想保留那种混乱又有默契的双人闯关能量,做成原创喜剧冒险。
故事有五个重要节点:
- “Night 100”挑战突然重置为 Night 1;
- 两名原创冒险者进入模块化幻想世界;
- 一朵绵羊形纸云打喷嚏,毁掉他们的桥;
- 雷暴突然出现,笑点转成追逐;
- 两人合并橙色与薄荷色能量,跃向传送门。
最初的制作简报按 30 秒来写。当前 GPT Image2 to Video 工具 生成的是 15 秒序列,所以我把长简报当作故事节点来源,没有把原时间标记当作必须逐秒执行的合同。分镜将这些决定压缩成五格,让我能在生成视频前先做判断。
第一步:用提示词划清故事边界
有用的提示词不只说明画风。我希望它能回答六个问题:
| 提示词要素 | 在这个项目中控制什么 |
|---|---|
| 输出规格 | 16:9 宽屏、动漫赛璐璐动画、短序列 |
| 角色锚点 | Zed 的蓝发和橙色连帽衫;Kio 的眼镜和薄荷色外套 |
| 世界锚点 | 模块化几何幻想世界、纸片树、方块桥 |
| 节点顺序 | 重置、进入、喜剧破坏、暴风追逐、合作收尾 |
| 完成质感 | 钴蓝、薄荷、橙色、月夜深蓝;动作清楚、轮廓利落 |
| 排除项 | 不出现真人相似形象、官方游戏素材、仿制 UI、Logo 或受版权保护的音频 |
如果现在重新为 15 秒流程写,我会使用下面这个精简版本:
Create an original 15-second 16:9 anime comedy-adventure in polished 2D cel animation.
Zed is an original adventurer with spiky cobalt hair, an orange hoodie, and black wristbands. Kio is an original adventurer with round glasses, a mint jacket, and a small floating camera orb. Keep their faces, hair, colors, outfits, and proportions recognizable across every beat. They must not resemble real creators.
Set the story in an original modular fantasy world built from hand-painted geometric stones and paper-like trees. Begin when a floating “Night 100” sign resets to “Night 1.” Reveal the world assembling around the pair. A sheep-shaped paper cloud sneezes and breaks their bridge. A lightning storm begins, forcing them to run together. End when their orange and mint wristbands ignite and they leap toward a glowing portal.
Use clear shot progression, expressive anime reactions, crisp silhouettes, cobalt, mint, orange, and moonlit navy. Original chiptune-percussion energy; no copyrighted melody.
Avoid real-person likenesses, official Minecraft textures, mobs, logos, tools, UI, branded usernames, copied game sounds, photorealism, face drift, costume changes, extra limbs, broken hands, unreadable text, and watermarks.
提示词定义了创作边界,同时也为图像系统留下了安排分镜的空间。
每次都要写这么详细吗?不需要。详细提示词让我主动规定更多边界;简短提示词会把更多决定交给分镜阶段,因此检查点更加重要。后文的一句话对照实验就是为此准备的。
如果你想更系统地把故事节点变成镜头,可以参考从剧本生成动漫分镜的流程。面对反复出现的角色,先定义一小组稳定的角色身份锚点,再生成多个角度。
第二步:先生成角色、世界和镜头序列
这是我最在意的一步。
工具会把故事转成一张宽屏分镜。在这次实验里,分镜包含:
- 两个角色的正面、侧面和背面视图;
- 浮空相机球与挑战牌道具;
- 模块化世界及配色;
- 一张简单的运镜图;
- 五格序列,以及每格的景别、动作、对白和情绪节点。
这张图就是我的检查点。
我能看到橙色与薄荷色的角色分工是否清楚,世界是否足够有趣,情绪是否从慌乱、惊奇、喜剧、紧张一路走向英雄式收尾。我也能提前找出高风险镜头:桥梁坍塌、两人并肩奔跑,以及传送门前的身体接触。
分镜还把系统的理解方式摆在了画面上。原简报写的是“adult”,实际角色却更年轻、更圆润。这个方向符合本次轻松实验,所以我接受了。如果角色年龄对故事很重要,我会在这里修改或重新生成,而不是把积分先花到视频阶段。
我会用下面六个问题快速检查分镜:
- 角色: 从多个角度看,我还能认出每个人吗?
- 世界: 环境能支持要求的动作吗?
- 序列: 不重读提示词,也能看懂故事吗?
- 节奏: 每一格是否增加了新动作、反应或信息?
- 风险: 哪一格包含手部、接触、快速运动、小脸或重要文字?
- 版权: 分镜有没有意外带入受保护的 Logo、角色、界面或真人相似形象?
只要有一项不合格,我会先修正静态计划。检查一张图,比检查几百帧运动画面快得多。
第三步:把确认后的分镜生成视频
接受分镜后,我开始生成视频。当前工具会把完整分镜作为 15 秒序列的视觉参考,而不是只拿一张开场图来引导后续画面。
如果要把这次实验的方法复用到其他项目,可以参考分镜图片转视频的逐镜头工作流。
导出文件时长 15.05 秒,分辨率 1280×720,帧率 24fps。成片保留了主要情节:
- 夸张的反应特写;
- 双角色方块世界揭晓;
- 绵羊云的喜剧节点;
- 暴风追逐;
- 橙色与薄荷色能量连接的结尾。

确认分镜后生成的 15 秒成片画面。
我仍然会像检查其他生成视频一样,检查面部、手部、角色比例、动作顺序、运镜清晰度、文字和结尾。分镜能缩小意外范围,但生成结果依然会有变化。
第二个实验:一句话生成五镜头广告
我想知道第一支成片是否完全依赖长提示词提前完成了制作规划。
因此我设计了一个信息极少的对照实验。完整文字提示词只有一句:
Generate a promotional video for the Xiaomi SU7 car.
界面里选择了 American 3D 视觉风格。除此之外,我没有写镜头表、配色、运镜、环境、音乐方向、口号或结尾。

这次对照实验的文字提示词只有一句,视觉风格通过界面单独选择。
生成的分镜补上了缺失的制作语言。它选择蓝色汽车与夜间城市的方向,并组织出五个定时镜头:
- 车灯苏醒的微距特写;
- 城市行驶英雄镜头;
- 车内主观视角;
- 桥梁与天际线广角揭晓;
- 干净的产品收尾画面。
分镜还补充了镜头焦段、景别、相机运动、短文案、声音提示、每个镜头的情绪、内饰氛围、运镜路径和配色。

分镜把一句话扩展成一份可检查的 15 秒商业短片计划。
| 文字提示词提供了 | 分镜补充了 |
|---|---|
| 产品和任务 | 蓝色高端视觉方向 |
| “宣传视频” | 五个各三秒的节点 |
| 没有运镜说明 | 微距、跟拍、主观、无人机和静态收尾 |
| 没有环境 | 霓虹城市、桥梁、天际线、内饰和棚拍结尾 |
| 没有声音或情绪 | 电流声、电影感低音、音乐重拍,以及每格情绪 |
这里的区别很重要。一句话里没有暗藏完整广告,工作流主动提出了一套制作方案,并把它变成我可以在花视频积分前检查的画面。
确认分镜后,导出结果同样是 15.046 秒、1280×720、24fps。成片从精致的车灯微距开始,经过夜间行驶与内饰视角,扩展到桥梁和天际线,最后以蓝色汽车和产品标题收尾。

15 秒结果保留了分镜中的蓝色汽车、夜间城市和高端商业片叙事。
动态画面没有逐帧照搬每个分镜格的时间,但主体、配色、环境、节奏升级和结尾保持了连贯。考虑到原提示词完全没有镜头或序列说明,这次具体生成结果已经很扎实。
这是一次独立的 AI 工作流演示,并非小米官方广告,也没有验证产品参数。任何商业使用前,品牌文字、车辆细节、宣传表述和视觉准确性仍需人工检查。
这次对照实验不能证明每一个一句话提示词都会生成好视频。它说明了一个更具体、更实用的事实:分镜层能把模糊要求变成可见的制作决定,我可以在动画生成前接受或拒绝这些决定。
为什么这个流程更经济
这两次都是实际制作案例,并非受控的模型或成本对比。我没有声称每一次“先分镜”都一定比每一次直接文生视频更便宜。严谨比较需要保持模型、设置、提示词和尝试次数一致。
实际价值更简单:我可以在一个画面决定变成视频决定之前拒绝它。
角色设计不对,我能在分镜上看到;环境气质偏了,我能在分镜上看到;笑点落在高潮之后,我也能在分镜上看到。项目仍是一张可检查的图时,我就能决定是否继续。
如果只是一个独立动作,一张图片生成单镜头视频可能就够了。包含多个场景的短片,可以用分镜为它们提供共同依据。更长的剧集适合进入完整的 AI 动漫视频工作流,让角色、场景、镜头、对白和修改都保持有序。
三步检查清单
每次生成视频前,我会问:
- 提示词: 主体、身份锚点、世界、可见节点顺序、完成质感和排除项都写清了吗?
- 分镜: 角色、环境、镜头推进、节奏、风险和版权都确认了吗?
- 视频: 动作是否遵循已确认序列?逐帧检查后,成片还能直接使用吗?
三步就够了。关键是把第二步当成真正的确认关口。
最后的结论
等一个坏镜头已经动起来后再发现问题,代价最高。
当画面限制很重要时,把它们明确写进故事。提示词很短时,更要仔细检查系统主动补充的决定。先生成一张能看清角色或产品、世界和序列的分镜,确认后再进入动画阶段。这样,视频模型可以专注解决动作,因为更多创作方向已经提前确定。
我就是这样把一份详细动漫提示词做成 Hype Survival,也把一句汽车提示词扩展成连贯的商业短片概念——无需等到积分花完后,才第一次看到一套隐形的制作方案。