一份詳細動漫提示詞、一個只有一句話的對照提示詞,以及兩支可檢查的 15 秒成片——都使用相同的三個步驟。
作者:Sonya,MkAnime 內容貢獻者 · 發布於 2026 年 8 月 9 日
說明:我參與 MkAnime 的內容工作,並在這個專案中使用 GPT Image2 to Video 流程。AI 協助整理和編輯本文。兩份提示詞、產生的分鏡、本機影片檔、公開的 YouTube 成片,以及目前產品流程,均已於 2026 年 8 月 8 日核對。
你有沒有花掉一大筆影片點數,等了很久,最後卻因為一個小鏡頭不滿意?
開頭可能很好,角色也正確,最後的動作甚至很精彩。可是某個鏡位、表情或轉場偏離想像,整段影片就很難使用。
這既花錢,也真的讓人心煩。
直接用提示詞產生影片時,一次生成要同時處理角色設計、場景、鏡頭順序、攝影選擇、節奏、動作和連貫性。只要其中一項走偏,通常要等到最花點數的階段結束後才會發現。
這次 15 秒動漫實驗中,我用了更簡單的三步流程:
1. 寫清楚故事與畫面限制
↓
2. 產生並檢查一張寬螢幕分鏡
↓
3. 將確認後的分鏡做成 15 秒影片
這套方法不能保證第一支影片就完美。它提供一個成本更低、心情更平穩的檢查點,讓我在畫面動起來之前先發現問題。

這張分鏡讓我在產生影片之前,就能看見角色、世界、鏡頭順序、運鏡選擇和情緒變化。
專案設定:兩名玩家闖進不可能的方塊世界
這個點子來自網路上對一場創作者遊戲馬拉松的討論。我不想重製真人創作者、官方遊戲素材、受保護角色、Logo 或介面,只想保留那種混亂又有默契的雙人合作能量,做成原創喜劇冒險。
故事有五個重要節點:
- 「Night 100」挑戰突然重設為 Night 1;
- 兩名原創冒險者進入模組化幻想世界;
- 一朵綿羊形紙雲打噴嚏,摧毀兩人的橋;
- 雷雨突然來臨,笑點轉成追逐;
- 兩人合併橘色與薄荷色能量,躍向傳送門。
最初的製作簡報以 30 秒為目標。目前 GPT Image2 to Video 工具 產生的是 15 秒序列,所以我把長簡報當作故事節點來源,沒有要求原時間標記逐秒照做。分鏡把這些決定壓縮成五格,讓我能在產生影片前先判斷方向。
第一步:用提示詞劃清故事邊界
好用的提示詞不只說明風格。我希望它能回答六個問題:
| 提示詞要素 | 在這個專案中控制什麼 |
|---|---|
| 輸出規格 | 16:9 寬螢幕、動漫賽璐璐動畫、短序列 |
| 角色錨點 | Zed 的藍髮和橘色連帽上衣;Kio 的眼鏡和薄荷色外套 |
| 世界錨點 | 模組化幾何幻想世界、紙片樹、方塊橋 |
| 節點順序 | 重設、進入、喜劇破壞、暴風追逐、合作收尾 |
| 完成質感 | 鈷藍、薄荷、橘色、月夜深藍;動作清楚、輪廓俐落 |
| 排除項目 | 不出現真人相似形象、官方遊戲素材、仿製 UI、Logo 或受版權保護的音訊 |
如果現在重新為 15 秒流程撰寫,我會使用下面這個精簡版本:
Create an original 15-second 16:9 anime comedy-adventure in polished 2D cel animation.
Zed is an original adventurer with spiky cobalt hair, an orange hoodie, and black wristbands. Kio is an original adventurer with round glasses, a mint jacket, and a small floating camera orb. Keep their faces, hair, colors, outfits, and proportions recognizable across every beat. They must not resemble real creators.
Set the story in an original modular fantasy world built from hand-painted geometric stones and paper-like trees. Begin when a floating “Night 100” sign resets to “Night 1.” Reveal the world assembling around the pair. A sheep-shaped paper cloud sneezes and breaks their bridge. A lightning storm begins, forcing them to run together. End when their orange and mint wristbands ignite and they leap toward a glowing portal.
Use clear shot progression, expressive anime reactions, crisp silhouettes, cobalt, mint, orange, and moonlit navy. Original chiptune-percussion energy; no copyrighted melody.
Avoid real-person likenesses, official Minecraft textures, mobs, logos, tools, UI, branded usernames, copied game sounds, photorealism, face drift, costume changes, extra limbs, broken hands, unreadable text, and watermarks.
提示詞定義了創作邊界,也為圖像系統留下安排分鏡的空間。
每次都要寫這麼詳細嗎?不用。詳細提示詞讓我主動規定更多邊界;簡短提示詞會把更多決定交給分鏡階段,因此檢查點更重要。後面的一句話對照實驗就是為了驗證這件事。
如果你想更完整地把故事節點變成鏡頭,可以參考從劇本產生動漫分鏡的流程。面對反覆出現的角色,先定義一小組穩定的角色識別錨點,再要求多個角度。
第二步:先產生角色、世界和鏡頭序列
這是我最在意的一步。
工具會把故事轉成一張寬螢幕分鏡。這次分鏡包含:
- 兩個角色的正面、側面和背面視圖;
- 浮空攝影球與挑戰牌道具;
- 模組化世界和配色;
- 一張簡單的鏡位圖;
- 五格序列,以及每格的景別、動作、對白和情緒節點。
這張圖就是我的檢查點。
我能看出橘色與薄荷色的角色分工是否清楚、世界是否足夠有趣,以及情緒是否從慌亂、驚奇、喜劇、緊張一路走向英雄式收尾。我也能先找出高風險鏡頭:橋梁倒塌、兩人並肩奔跑,以及傳送門前的身體接觸。
分鏡也把系統的理解方式呈現在畫面上。原簡報寫的是「adult」,實際角色卻更年輕、更圓潤。這個方向符合本次輕鬆實驗,所以我接受了。若年齡呈現對故事很重要,我會在這裡修改或重新產生,再決定是否花點數做影片。
我會用六個問題快速檢查分鏡:
- 角色: 從多個角度看,我還能認出每個人嗎?
- 世界: 場景能支援要求的動作嗎?
- 序列: 不重讀提示詞,也能看懂故事嗎?
- 節奏: 每一格是否增加新動作、反應或資訊?
- 風險: 哪一格包含手部、接觸、快速動作、小臉或重要文字?
- 權利: 分鏡有沒有意外帶入受保護的 Logo、角色、介面或真人相似形象?
只要有一項沒通過,我會先修正靜態計畫。檢查一張圖,比檢查數百格動態畫面快得多。
第三步:把確認後的分鏡產生為影片
接受分鏡後,我開始產生影片。目前工具會把完整分鏡當作 15 秒序列的視覺參考,而不只使用一張開場畫面引導後續內容。
若要把這次實驗的方法用在其他專案,可以參考分鏡圖片轉影片的逐鏡頭工作流程。
匯出檔案長 15.05 秒,解析度 1280×720,影格率 24fps。成片保留了主要情節:
- 誇張的反應特寫;
- 雙角色方塊世界揭曉;
- 綿羊雲的喜劇節點;
- 暴風追逐;
- 橘色與薄荷色能量連結的結尾。

確認分鏡後產生的 15 秒成片畫面。
我仍會檢查臉部、手部、角色比例、動作順序、運鏡清晰度、文字和結尾。分鏡能縮小意外範圍,產生結果仍然會有變化。
第二個實驗:一句話產生五鏡頭廣告
我想知道第一支成片是否完全依賴長提示詞提前完成製作規劃。
因此我做了一個資訊極少的對照實驗。完整文字提示詞只有一句:
Generate a promotional video for the Xiaomi SU7 car.
我在介面中選擇 American 3D 視覺風格,沒有另外寫鏡頭表、配色、運鏡、場景、音樂方向、標語或結尾。

這次對照實驗的文字提示詞只有一句,視覺風格在介面中另外選擇。
產生的分鏡補上了缺少的製作語言。它選擇藍色車輛與夜間城市的方向,並安排出五個定時鏡頭:
- 車燈甦醒的微距特寫;
- 城市行駛英雄鏡頭;
- 車內主觀視角;
- 橋梁與天際線廣角揭曉;
- 乾淨的產品收尾畫面。
分鏡還補充了鏡頭焦段、景別、攝影機移動、短文案、音效提示、每格情緒、內裝氛圍、鏡位路徑和配色。

分鏡把一句話擴展成可檢查的 15 秒商業短片計畫。
| 文字提示詞提供了 | 分鏡補充了 |
|---|---|
| 產品和任務 | 藍色高級視覺方向 |
| 「宣傳影片」 | 五個各三秒的節點 |
| 沒有運鏡說明 | 微距、跟拍、主觀、空拍和靜態收尾 |
| 沒有場景 | 霓虹城市、橋梁、天際線、內裝和棚拍結尾 |
| 沒有聲音或情緒 | 電流聲、電影感低音、音樂重拍,以及每格情緒 |
這個差別很重要。一句話裡沒有藏著完整廣告;工作流程主動提出一套製作方案,並把它變成我能在花影片點數前檢查的畫面。
確認分鏡後,匯出結果同樣為 15.046 秒、1280×720、24fps。成片從精緻的車燈微距開始,經過夜間行駛與內裝視角,擴展到橋梁和天際線,最後以藍色汽車與產品標題收尾。

15 秒結果保留了分鏡中的藍色汽車、夜間城市與高級商業片走向。
動態畫面沒有逐格照搬分鏡時間,主體、配色、場景、節奏推進和結尾仍維持連貫。原提示詞完全沒有鏡頭或序列指示,這次具體產出已相當扎實。
這是獨立的 AI 工作流程展示,並非小米官方廣告,也沒有驗證產品規格。任何商業使用前,品牌文字、車輛細節、宣傳說法和視覺準確性仍需人工檢查。
這次對照不能證明每個一句話提示詞都會產生好影片。它說明一件更具體、更實用的事:分鏡階段能把模糊需求變成看得見的製作決定,我可以在動畫生成前接受或拒絕這些決定。
為什麼這個流程更經濟
這兩次都是實際製作案例,並非受控的模型或成本比較。我沒有主張每次先做分鏡都一定比直接文生影片便宜;嚴謹比較需要保持模型、設定、提示詞和嘗試次數一致。
實際價值更簡單:我可以在畫面決定變成影片決定之前拒絕它。
角色設計不對、場景調性偏掉,或笑點落在高潮之後,我都能在分鏡上看見。當專案仍是一張可檢查的圖時,我就能決定要不要繼續。
如果只是一個獨立動作,一張圖片產生單鏡頭影片可能就夠了。包含多個場景的短片,可以用分鏡提供共同依據。更長的作品適合進入完整的 AI 動漫影片工作流程,讓角色、場景、鏡頭、對白和修改保持有序。
三步檢查清單
每次產生影片前,我會問:
- 提示詞: 主體、識別錨點、世界、可見節點順序、完成質感和排除項目都寫清楚了嗎?
- 分鏡: 角色、場景、鏡頭推進、節奏、風險和權利問題都確認了嗎?
- 影片: 動作是否遵循已確認序列?逐格檢查後,成片仍能直接使用嗎?
三個步驟就夠了。關鍵是把第二步當成真正的確認關卡。
最後的結論
等一個壞鏡頭已經動起來後才發現問題,代價最高。
畫面限制很重要時,就把它們明確寫進故事。提示詞很短時,更要仔細檢查系統主動補充的決定。先產生一張能看清角色或產品、世界和序列的分鏡,確認後再進入動畫階段。這樣影片模型能更專心處理動作,因為更多創作方向已經提前確定。
我就是這樣把一份詳細動漫提示詞做成 Hype Survival,也把一句汽車提示詞擴展成連貫的商業短片概念——不必等點數花完後,才第一次看到一套隱形的製作方案。