TAIPEI · SOLO FILM PREVIZ 1930 BREAKDOWN

一部年代劇,先做成看得到的樣子

《金曲之戀1930》:現代金曲舞台上燈具墜落,醒來在 1930 年的老宅儲物室。
這是拿來給人「先看到」的 previz:1 分 44 秒、18 鏡、5 天,全部 AI 生成。
先看片,再往下拆:prompt 實際怎麼寫、哪幾件事把我卡住、哪幾件到現在還沒解。

previz 1 分 44 秒 · 18 鏡 · 純 AI 生成 · 非最終成片

這頁不是成功案例展示。被擋掉的、跑歪的、到現在還沒解的,都寫在裡面。

這支片要解什麼

年代劇最貴的不是拍,是「講不清楚」

一個穿越題材的年代劇構想,要讓人點頭,卡在同一個地方: 對方在點頭之前,看不到東西。 大型頒獎舞台、1930 年的老宅儲物室、一個女主角兩個世界—— 這些在紙上都只是形容詞。你講「冷金藍的舞台切到暖琥珀的木頭房間」, 每個人腦裡跑出來的畫面都不一樣。

實拍一段來給人看?場地、群眾演員、年代美術、造型, 光是為了「證明這個世界成立」就得付一整套製作費,而且拍完還不確定會不會過。

判準

previz 的價值不在畫面漂亮,在把爭論從形容詞搬到畫面上。 看得到,才有得改。做這支片的目的只有一個: 讓「這個故事長什麼樣」變成一件可以被指著討論的事。

實際規模

項目數字
成片長度1 分 44 秒(103.9 秒)
定稿鏡數18 鏡(S01–S18),含變體共 21 塊雙塊腳本
分鏡圖28 張(含首尾幀與重生版本)
每鏡生成次數2–3 版,進剪輯台再挑
製作期間2026-06-02 → 06-06
輸出規格1080×1920 直式 H.264
人力1 人

這是 demo 的規模,不是接案報價的依據。有客戶驗收流程的專案, 改版次數與素材準備會是完全不同的量級。

動手之前先鎖死

四條規格,寫在每一鏡的最上面

18 鏡不是 18 個獨立任務。開工前先把四件事鎖死,寫進每一鏡的腳本抬頭, 之後每一鏡都照抄。這四條後來每一條都因為違反過而付出代價(下一節就是)。

規格內容為什麼
比例 所有參考圖、分鏡圖、輸出一律 9:16 任何一張餵進去的參考圖比例不對,模型會自己裁切或補畫,破圖、跳接、破 180 度線都從這裡來
色調 場景一(現代舞台)冷金藍;場景二(1930 儲物室)暖琥珀木 兩個世界要一眼分得出來,這是穿越題材唯一免費的敘事工具
文字 字幕、海報、LED 全部留空,後期疊上去(CN-TEXT) 模型寫中文會拼出亂碼,尤其是年代招牌與刻字
負面詞 生圖與生影片各一組,固定不動 手指、morphing、融臉是這類題材最常爆的三個點
固定負面詞
生圖負面:
extra fingers, distorted hands, two heads, watermark, text, flat lighting, CGI
(場景二/閃回再加 modern objects)

生影片負面:
distorted hands, extra fingers, morphing, flickering, melting face

modern objects 這一條只在 1930 的鏡次加。 不加的話,儲物室裡會冒出塑膠感的收納箱、現代插座、太乾淨的玻璃。

核心方法

一鏡兩塊:一塊管長相,一塊只管動

最有效的一個改動:把「這一鏡長什麼樣」和「這一鏡怎麼動」拆成兩塊分開寫。 不是為了整齊,是因為兩塊如果混在一起,你會在生影片的時候重寫一次光影, 而模型會照著新的光影重畫,首幀就白做了。

第一塊:生圖 prompt(英文,持絕對霸權)

這一塊產出首幀,決定這一鏡的全部長相。 風格、光影、鏡頭焦段、質感、色調、負面詞,全部寫在這裡,寫滿。 同時上傳這一鏡要用到的角色設計表與場景設計表,鎖一致性。

角色設計表:多角度與多表情格
角色設計表 · 多角度+表情格 · 每一鏡指定其中一格
1930 老宅儲物室場景設計表
場景設計表 · 儲物室 · 道具與材質靠這張鎖住,不靠文字描述

場景與道具的一致性靠設計表,不靠形容詞。 「昏暗的老儲物室」寫十次會得到十個房間;上傳同一張場景表,才會是同一個房間。

第二塊:生影片 prompt(中文,做減法)

這一塊只做一件事:分配運動的算力。它包含四項,其他一律不寫。

  1. 單一運鏡:一鏡只給一個運鏡。推、搖、俯衝,選一個。
  2. 時間軸動作:0-3s 做什麼、3-6s 做什麼,切段寫。
  3. 物理視覺參照:衣角被氣流掀起、呼出白霧、踩出腳印。禁止寫數值(「轉 30 度」模型讀不懂,「髮絲向上掀起」讀得懂)。
  4. 因果鏈:她轉頭是因為聽到聲音,不是「她轉頭」。

光影欄位只寫一句 keep the first-frame lighting unchanged。 這句話是這套方法的關鍵:它明確告訴模型不要重打光。

一句話

生圖那塊寫滿,生影片那塊寫少。 算力就那麼多,你在生影片階段每多描述一項長相,就少一分力氣拿去算運動。

完整範例:S14 女主角在鏡子前認出自己不是自己

這是全片的關鍵鏡。三塊全文照貼,包含首幀、尾幀、生影片。

S14 首幀:鏡中的臉
首幀 START
踉蹌撲近鏡子
S14 尾幀:怼臉極特寫,手觸自己的臉
尾幀 END
怼臉、手摸自己的臉
〔生圖 prompt〕首幀
Extreme close-up of Lin Zhixia's face (same face as uploaded sheet) reflected in an old cracked dusty mirror in the dim storeroom, pale, gaunt, weary yet gentle, smudged with dust, shock and confusion, messy hair, cracks fragmenting the reflection. 85mm f/1.8 extreme shallow depth of field. Soft side light plus dust light at the mirror. Warm amber, low saturation, film grain. Fear, identity shattering. Photorealistic cinematic still. negative: modern objects, extra fingers, distorted hands, two heads, watermark, text, CGI.
〔生圖 prompt〕尾幀
Vertical 9:16. Extreme close-up, Lin Zhixia's gaunt pale face (same face as uploaded sheet) filling the frame in the old cracked dusty mirror, dust-smudged skin, wide disbelieving eyes, a hand just touching her own cheek, mirror cracks fragmenting the reflection. 85mm f/1.8 extreme shallow depth of field. Soft dusty side light. Warm amber, low saturation, film grain. Identity shattering. Photorealistic cinematic still. negative: extra fingers, distorted hands, two heads, watermark, text, flat lighting, CGI, modern objects.
〔生影片 prompt〕
Scene:她撲向鏡子怼臉。
Camera:緩推至怼臉極特寫。
Lighting:keep the first-frame lighting unchanged。
Mood:恐懼、身分崩裂。
Actions(因果):
0-3s:她踉蹌撲近鏡子、雙手撐牆。
3-6s:怼臉端詳、瞳孔震顫、伸手摸自己的臉、難以置信地後縮。
negative:distorted hands, extra fingers, morphing, flickering, melting face。

注意生影片那塊有多短。光影一句話帶過,長相一個字都沒寫—— 因為長相已經在首幀與尾幀裡了,重寫只會讓模型改。

最好用的一招

首尾幀:把六秒的不確定性壓成兩張圖

只給首幀,模型會自己決定幾秒後長什麼樣,而它的決定通常不是你要的。 首尾幀一起給,等於畫出起點與終點,中間才是它發揮的空間。

全片最吃這招的是 S07:燈具從舞台高處鬆脫, 鏡頭是燈具自己的第一視角,垂直俯衝向下方仰望的女主角。 這種鏡頭實拍要架特技威亞加高速攝影,AI 這邊要處理的是另一個問題: 幾秒之內,人要從遠處小小一個變成佔滿畫面。中間任何一段失控,整鏡報廢。

S07 · 燈具 POV 垂直俯衝 · 首尾幀鎖定 · 720p 9:16
S07 生影片 prompt(全文)
Scene:鬆脫燈罩/燈具第一視角,從高處俯衝向台上驚恐仰望的萱萱。
Camera:第一人稱 POV,從頭頂高處急速垂直俯衝向下(單一運鏡)。
Lighting:keep the first-frame lighting unchanged。
Mood:墜落、命運砸落、強衝擊。
Actions(因果/物理):
0-1s:高處俯瞰,萱萱在下方仰頭、瞳孔驟縮、張口驚呼。
1-3s:鏡頭急速下墜、她迅速放大,舉起手臂擋向鏡頭,髮絲與裙襬被氣流向上掀起。
3-4s:撞擊瞬間,畫面被強白光爆滿,瞬切全黑。
negative:distorted hands, extra fingers, morphing, flickering, melting face。

「髮絲與裙襬被氣流向上掀起」就是物理視覺參照。 它不是修辭,是在告訴模型:這是往下墜,不是往下拉近。 沒有這一句,同樣的首尾幀會得到一個平順的 zoom in。

S07 首幀分鏡圖:燈具俯衝視角
S07 首幀分鏡 · 強俯角+邊緣動態模糊,先在圖上決定
工具面的坑

首尾幀這個功能在 Seedance 2.0 的 API/MCP 介面跑得起來, 但同一時期網頁 UI 上沒有開放這個選項。 我是用程式介面驗證出來的。如果你只用網頁版試,會以為這招做不到。

首尾幀不是合約,是建議。模型會抵達你給的終點,中間仍會自己發揮, 發揮的空間靠「一鏡只做一件事」壓縮。

燒掉的點數

三個把我卡住的錯,全部是自己造成的

錯誤一:把所有東西都餵進去

最直覺、也最貴的錯:一次上傳三張角色設計表、加分鏡圖、加場景設計表, 再配一段寫滿細節的超長 prompt,想說「資訊越多越準」。

結果相反。模型被塞爆之後開始丟細節: 角色的臉混到另一個角色身上、指定的道具不見、 最誇張的一次,它直接跑出一個我沒寫的結局

教訓

參考圖不是越多越好,是越準越好。 一鏡只上傳這一鏡真正需要的那一張角色表+那一張場景表。 超長 prompt 不是更精確,是讓模型自己決定要忽略哪一段。

錯誤二:參考圖比例不是 9:16

混進一張 16:9 或 1:1 的參考圖,模型不會報錯,它會自己想辦法。 結果是破圖、構圖被裁掉一半、下一鏡的角色站到畫面另一邊—— 也就是破 180 度線,剪在一起會像兩個不同場次。

這是那種「不會當場失敗、剪的時候才發現」的錯,所以最貴。 現在的做法是:任何素材進 pipeline 之前先檢查比例,不對就重出,不修。

錯誤三:想讓模型寫中文字

年代招牌、報紙標題、獎座刻字,看起來很值得讓模型順手畫上去。 實際跑出來是錯字與亂碼——形狀像中文,但不是字。 放大看很明顯,觀眾會第一眼發現。

所以全片沒有任何一個字是生成的。所有文字留白,後期疊上去。 這也是前面那條 CN-TEXT 規格的由來。

S01 舞台大全景首幀
S01 舞台大全景
LED 與看板全部留白
S18 收尾特寫首幀
S18 收尾
暖琥珀木色調
不是你寫錯,是它不讓你做

商標偵測擋掉整個開場,而且扣點不退

故事開場設定在一場真實存在的音樂頒獎典禮。 這件事在生成端直接撞牆:Seedance 的內容檢查回 ip_detected, 判定畫面涉及真實商標,任務被擋。

被擋的不只獎座與標誌。整個頒獎典禮的畫面組合—— 舞台、獎座、頒獎動作、鏡頭語言——被一起判定,也就是說, 不是把標誌塗掉就能過。

代價

被擋下來的任務照樣扣點,不退。 更麻煩的是 get_cost 這類查詢介面抓不到這種被擋任務的花費, 帳目對不起來。你只會發現點數少了,但不知道少在哪幾次。

怎麼繞過去

這一段值得單獨記住:在你寫下任何真實品牌、真實比賽、真實歌曲之前, 先假設它會被擋,而且擋下來的那一次你要付錢。

還沒解決的問題

聲音是這支片最弱的一環

畫面卡住還能重生,聲音卡住是整條路要換。這件事試了幾種做法, 前面幾種都不成立,最後那條能跑但還沒到可交付的水準。

做法結果為什麼
純 TTS 配音(Voai) 不採用 咬字清楚,但情緒太平。這支片全靠情緒撐,平掉就沒有戲
Seedance 直接生成人聲 不採用 自然度好很多,但綁不住聲線——同一個角色每一鏡都是不同的人
Kling 3.0(Higgsfield 版) 不可行 沒有 voice binding、沒有 audio role,這條路走不通
Seedance 採集 → 聲音克隆 → audio role 對嘴 目前這條 可以跑:先從 Seedance 生成的自然人聲挑一段當樣本,克隆成固定 voice,再回頭綁定對嘴。但一致性還不夠穩

這條路能通的關鍵在於:audio role 這個功能只有 Seedance 2.0 有。 如果你的角色需要跨鏡頭維持同一個聲音,模型選擇會在這裡被決定, 而不是在畫面品質上被決定。

誠實講

聲線一致性到現在還沒完全解決。 這也是為什麼上面那支 previz 的定位是「先看到故事長什麼樣」, 不是「這就是成片」。

生成之外

生成只是素材,片是在剪接台上成立的

一鏡滾 2–3 版,不是滾到滿意

每一鏡固定生 2–3 版就停,全部丟進剪輯台,在時間軸上比。 理由很實際:單看一鏡「好不好」是假問題, 一鏡好不好要看它接不接得上前後鏡。在生成介面裡反覆微調, 通常是在優化一個等一下會被剪掉的東西。

S17 · 其中一版 · 進剪輯台前的素材,不是最終選用版

粗剪之後,只重生最糟的 3–5 鏡

粗剪串起來大約 90 秒,看整條,標出 AI 破綻:手指、臉、年代不對的物件、接點跳掉。 然後只挑最糟的 3–5 鏡重生。不是每一鏡都重來—— 重來一輪的成本是全片的成本,而觀眾只會注意到最糟的那幾鏡。

草稿低規、hero 才上高規

15 秒 1080p 的生成燒點很快。順序是:所有鏡先用低規格跑通剪輯邏輯, 確定這條剪得起來,才把要用的那幾鏡上高規重生。 反過來做的話,你會用最貴的規格生出一堆最後不會用的素材。

兩條路徑的取捨

路徑做法用在哪
A(推薦) 一鏡一張 start frame,逐鏡生成 要真的剪成片,就走這條。可控、可重生單鏡
B 九宮格 storyboard 一張圖出完 只做節奏預覽用。快、便宜,但不能拿來剪

角色皮膚在生圖模型出的設計表上會有「畫感」,這在靜態圖上很明顯, 動起來反而會被影格修掉——所以不要為了設計表的皮膚質感反覆重生,那是浪費。

給想自己做的人

照這個順序做,別照我的第一次做

  1. 先確定要解的是「講不清楚」:如果東西已經講得清楚,做 previz 是浪費。
  2. 先出角色設計表與場景設計表:多角度、多表情格。這兩張是後面所有一致性的地基。
  3. 鎖四條規格:9:16、兩世界色調、文字不進生成、固定負面詞。寫進每一鏡抬頭。
  4. 一鏡拆兩塊寫:生圖那塊寫滿長相,生影片那塊只寫運鏡+時間軸+物理參照+因果。
  5. 先做一鏡驗證,挑最可能崩的那一鏡:不是最好看的那一鏡。這支片是 S07 的 POV 俯衝。
  6. 驗過再開全片:草稿低規跑通剪輯邏輯,先不上高規。
  7. 每鏡 2–3 版就停,丟進剪輯台比,不在生成介面裡反覆微調。
  8. 粗剪後標破綻,只重生最糟的 3–5 鏡
  9. 文字、字幕、音效全部後期:生成階段一個字都不要讓它寫。
  10. 記帳:包含被擋下來扣掉的點數。不記的話,你不會知道哪一種做法真的比較便宜。
說明

本頁分享的是這支 demo 的拆解方法與限制; 不代表已由客戶驗收、劇組採用,或已驗證達到實拍效果。 聲線一致性、角色真實度、鏡與鏡的銜接,都還是未解決的問題。

下一步

你是哪一種