《金曲之戀1930》:現代金曲舞台上燈具墜落,醒來在 1930 年的老宅儲物室。
這是拿來給人「先看到」的 previz:1 分 44 秒、18 鏡、5 天,全部 AI 生成。
先看片,再往下拆:prompt 實際怎麼寫、哪幾件事把我卡住、哪幾件到現在還沒解。
這頁不是成功案例展示。被擋掉的、跑歪的、到現在還沒解的,都寫在裡面。
一個穿越題材的年代劇構想,要讓人點頭,卡在同一個地方: 對方在點頭之前,看不到東西。 大型頒獎舞台、1930 年的老宅儲物室、一個女主角兩個世界—— 這些在紙上都只是形容詞。你講「冷金藍的舞台切到暖琥珀的木頭房間」, 每個人腦裡跑出來的畫面都不一樣。
實拍一段來給人看?場地、群眾演員、年代美術、造型, 光是為了「證明這個世界成立」就得付一整套製作費,而且拍完還不確定會不會過。
previz 的價值不在畫面漂亮,在把爭論從形容詞搬到畫面上。 看得到,才有得改。做這支片的目的只有一個: 讓「這個故事長什麼樣」變成一件可以被指著討論的事。
| 項目 | 數字 |
|---|---|
| 成片長度 | 1 分 44 秒(103.9 秒) |
| 定稿鏡數 | 18 鏡(S01–S18),含變體共 21 塊雙塊腳本 |
| 分鏡圖 | 28 張(含首尾幀與重生版本) |
| 每鏡生成次數 | 2–3 版,進剪輯台再挑 |
| 製作期間 | 2026-06-02 → 06-06 |
| 輸出規格 | 1080×1920 直式 H.264 |
| 人力 | 1 人 |
這是 demo 的規模,不是接案報價的依據。有客戶驗收流程的專案, 改版次數與素材準備會是完全不同的量級。
18 鏡不是 18 個獨立任務。開工前先把四件事鎖死,寫進每一鏡的腳本抬頭, 之後每一鏡都照抄。這四條後來每一條都因為違反過而付出代價(下一節就是)。
| 規格 | 內容 | 為什麼 |
|---|---|---|
| 比例 | 所有參考圖、分鏡圖、輸出一律 9:16 | 任何一張餵進去的參考圖比例不對,模型會自己裁切或補畫,破圖、跳接、破 180 度線都從這裡來 |
| 色調 | 場景一(現代舞台)冷金藍;場景二(1930 儲物室)暖琥珀木 | 兩個世界要一眼分得出來,這是穿越題材唯一免費的敘事工具 |
| 文字 | 字幕、海報、LED 全部留空,後期疊上去(CN-TEXT) | 模型寫中文會拼出亂碼,尤其是年代招牌與刻字 |
| 負面詞 | 生圖與生影片各一組,固定不動 | 手指、morphing、融臉是這類題材最常爆的三個點 |
生圖負面: extra fingers, distorted hands, two heads, watermark, text, flat lighting, CGI (場景二/閃回再加 modern objects) 生影片負面: distorted hands, extra fingers, morphing, flickering, melting face
modern objects 這一條只在 1930 的鏡次加。 不加的話,儲物室裡會冒出塑膠感的收納箱、現代插座、太乾淨的玻璃。
最有效的一個改動:把「這一鏡長什麼樣」和「這一鏡怎麼動」拆成兩塊分開寫。 不是為了整齊,是因為兩塊如果混在一起,你會在生影片的時候重寫一次光影, 而模型會照著新的光影重畫,首幀就白做了。
這一塊產出首幀,決定這一鏡的全部長相。 風格、光影、鏡頭焦段、質感、色調、負面詞,全部寫在這裡,寫滿。 同時上傳這一鏡要用到的角色設計表與場景設計表,鎖一致性。
場景與道具的一致性靠設計表,不靠形容詞。 「昏暗的老儲物室」寫十次會得到十個房間;上傳同一張場景表,才會是同一個房間。
這一塊只做一件事:分配運動的算力。它包含四項,其他一律不寫。
光影欄位只寫一句 keep the first-frame lighting unchanged。 這句話是這套方法的關鍵:它明確告訴模型不要重打光。
生圖那塊寫滿,生影片那塊寫少。 算力就那麼多,你在生影片階段每多描述一項長相,就少一分力氣拿去算運動。
這是全片的關鍵鏡。三塊全文照貼,包含首幀、尾幀、生影片。
Extreme close-up of Lin Zhixia's face (same face as uploaded sheet) reflected in an old cracked dusty mirror in the dim storeroom, pale, gaunt, weary yet gentle, smudged with dust, shock and confusion, messy hair, cracks fragmenting the reflection. 85mm f/1.8 extreme shallow depth of field. Soft side light plus dust light at the mirror. Warm amber, low saturation, film grain. Fear, identity shattering. Photorealistic cinematic still. negative: modern objects, extra fingers, distorted hands, two heads, watermark, text, CGI.
Vertical 9:16. Extreme close-up, Lin Zhixia's gaunt pale face (same face as uploaded sheet) filling the frame in the old cracked dusty mirror, dust-smudged skin, wide disbelieving eyes, a hand just touching her own cheek, mirror cracks fragmenting the reflection. 85mm f/1.8 extreme shallow depth of field. Soft dusty side light. Warm amber, low saturation, film grain. Identity shattering. Photorealistic cinematic still. negative: extra fingers, distorted hands, two heads, watermark, text, flat lighting, CGI, modern objects.
Scene:她撲向鏡子怼臉。 Camera:緩推至怼臉極特寫。 Lighting:keep the first-frame lighting unchanged。 Mood:恐懼、身分崩裂。 Actions(因果): 0-3s:她踉蹌撲近鏡子、雙手撐牆。 3-6s:怼臉端詳、瞳孔震顫、伸手摸自己的臉、難以置信地後縮。 negative:distorted hands, extra fingers, morphing, flickering, melting face。
注意生影片那塊有多短。光影一句話帶過,長相一個字都沒寫—— 因為長相已經在首幀與尾幀裡了,重寫只會讓模型改。
只給首幀,模型會自己決定幾秒後長什麼樣,而它的決定通常不是你要的。 首尾幀一起給,等於畫出起點與終點,中間才是它發揮的空間。
全片最吃這招的是 S07:燈具從舞台高處鬆脫, 鏡頭是燈具自己的第一視角,垂直俯衝向下方仰望的女主角。 這種鏡頭實拍要架特技威亞加高速攝影,AI 這邊要處理的是另一個問題: 幾秒之內,人要從遠處小小一個變成佔滿畫面。中間任何一段失控,整鏡報廢。
Scene:鬆脫燈罩/燈具第一視角,從高處俯衝向台上驚恐仰望的萱萱。 Camera:第一人稱 POV,從頭頂高處急速垂直俯衝向下(單一運鏡)。 Lighting:keep the first-frame lighting unchanged。 Mood:墜落、命運砸落、強衝擊。 Actions(因果/物理): 0-1s:高處俯瞰,萱萱在下方仰頭、瞳孔驟縮、張口驚呼。 1-3s:鏡頭急速下墜、她迅速放大,舉起手臂擋向鏡頭,髮絲與裙襬被氣流向上掀起。 3-4s:撞擊瞬間,畫面被強白光爆滿,瞬切全黑。 negative:distorted hands, extra fingers, morphing, flickering, melting face。
「髮絲與裙襬被氣流向上掀起」就是物理視覺參照。 它不是修辭,是在告訴模型:這是往下墜,不是往下拉近。 沒有這一句,同樣的首尾幀會得到一個平順的 zoom in。
首尾幀這個功能在 Seedance 2.0 的 API/MCP 介面跑得起來, 但同一時期網頁 UI 上沒有開放這個選項。 我是用程式介面驗證出來的。如果你只用網頁版試,會以為這招做不到。
首尾幀不是合約,是建議。模型會抵達你給的終點,中間仍會自己發揮, 發揮的空間靠「一鏡只做一件事」壓縮。
最直覺、也最貴的錯:一次上傳三張角色設計表、加分鏡圖、加場景設計表, 再配一段寫滿細節的超長 prompt,想說「資訊越多越準」。
結果相反。模型被塞爆之後開始丟細節: 角色的臉混到另一個角色身上、指定的道具不見、 最誇張的一次,它直接跑出一個我沒寫的結局。
參考圖不是越多越好,是越準越好。 一鏡只上傳這一鏡真正需要的那一張角色表+那一張場景表。 超長 prompt 不是更精確,是讓模型自己決定要忽略哪一段。
混進一張 16:9 或 1:1 的參考圖,模型不會報錯,它會自己想辦法。 結果是破圖、構圖被裁掉一半、下一鏡的角色站到畫面另一邊—— 也就是破 180 度線,剪在一起會像兩個不同場次。
這是那種「不會當場失敗、剪的時候才發現」的錯,所以最貴。 現在的做法是:任何素材進 pipeline 之前先檢查比例,不對就重出,不修。
年代招牌、報紙標題、獎座刻字,看起來很值得讓模型順手畫上去。 實際跑出來是錯字與亂碼——形狀像中文,但不是字。 放大看很明顯,觀眾會第一眼發現。
所以全片沒有任何一個字是生成的。所有文字留白,後期疊上去。 這也是前面那條 CN-TEXT 規格的由來。
故事開場設定在一場真實存在的音樂頒獎典禮。 這件事在生成端直接撞牆:Seedance 的內容檢查回 ip_detected, 判定畫面涉及真實商標,任務被擋。
被擋的不只獎座與標誌。整個頒獎典禮的畫面組合—— 舞台、獎座、頒獎動作、鏡頭語言——被一起判定,也就是說, 不是把標誌塗掉就能過。
被擋下來的任務照樣扣點,不退。 更麻煩的是 get_cost 這類查詢介面抓不到這種被擋任務的花費, 帳目對不起來。你只會發現點數少了,但不知道少在哪幾次。
這一段值得單獨記住:在你寫下任何真實品牌、真實比賽、真實歌曲之前, 先假設它會被擋,而且擋下來的那一次你要付錢。
畫面卡住還能重生,聲音卡住是整條路要換。這件事試了幾種做法, 前面幾種都不成立,最後那條能跑但還沒到可交付的水準。
| 做法 | 結果 | 為什麼 |
|---|---|---|
| 純 TTS 配音(Voai) | 不採用 | 咬字清楚,但情緒太平。這支片全靠情緒撐,平掉就沒有戲 |
| Seedance 直接生成人聲 | 不採用 | 自然度好很多,但綁不住聲線——同一個角色每一鏡都是不同的人 |
| Kling 3.0(Higgsfield 版) | 不可行 | 沒有 voice binding、沒有 audio role,這條路走不通 |
| Seedance 採集 → 聲音克隆 → audio role 對嘴 | 目前這條 | 可以跑:先從 Seedance 生成的自然人聲挑一段當樣本,克隆成固定 voice,再回頭綁定對嘴。但一致性還不夠穩 |
這條路能通的關鍵在於:audio role 這個功能只有 Seedance 2.0 有。 如果你的角色需要跨鏡頭維持同一個聲音,模型選擇會在這裡被決定, 而不是在畫面品質上被決定。
聲線一致性到現在還沒完全解決。 這也是為什麼上面那支 previz 的定位是「先看到故事長什麼樣」, 不是「這就是成片」。
每一鏡固定生 2–3 版就停,全部丟進剪輯台,在時間軸上比。 理由很實際:單看一鏡「好不好」是假問題, 一鏡好不好要看它接不接得上前後鏡。在生成介面裡反覆微調, 通常是在優化一個等一下會被剪掉的東西。
粗剪串起來大約 90 秒,看整條,標出 AI 破綻:手指、臉、年代不對的物件、接點跳掉。 然後只挑最糟的 3–5 鏡重生。不是每一鏡都重來—— 重來一輪的成本是全片的成本,而觀眾只會注意到最糟的那幾鏡。
15 秒 1080p 的生成燒點很快。順序是:所有鏡先用低規格跑通剪輯邏輯, 確定這條剪得起來,才把要用的那幾鏡上高規重生。 反過來做的話,你會用最貴的規格生出一堆最後不會用的素材。
| 路徑 | 做法 | 用在哪 |
|---|---|---|
| A(推薦) | 一鏡一張 start frame,逐鏡生成 | 要真的剪成片,就走這條。可控、可重生單鏡 |
| B | 九宮格 storyboard 一張圖出完 | 只做節奏預覽用。快、便宜,但不能拿來剪 |
角色皮膚在生圖模型出的設計表上會有「畫感」,這在靜態圖上很明顯, 動起來反而會被影格修掉——所以不要為了設計表的皮膚質感反覆重生,那是浪費。
本頁分享的是這支 demo 的拆解方法與限制; 不代表已由客戶驗收、劇組採用,或已驗證達到實拍效果。 聲線一致性、角色真實度、鏡與鏡的銜接,都還是未解決的問題。