← 文章

大杯居創業日誌 Day 06|我把美感外包了

哎,我做了一堆 AI slop。

今天

今天我終於把 AI 產影片的產線打通了。

歌是我自己的 Demo 〈有雲山歌〉,用 Suno 做了日文 Bossa Nova 的版本。

分鏡和提示詞在 Claude Code 裡寫。

每顆鏡頭的第一張畫面,交給 Codex 生圖。

生出來的圖送進 fal 上的 MiniMax H3 Max Turbo,768p,讓它動起來。

人聲用 Demucs 從伴奏裡剝出來,再跑 faster-whisper 抓每一句的進出點,字幕才跟得上嘴。

最後用 ffmpeg 照著一份時間軸檔案組起來。

關鍵在最後那一句。

我沒有把剪接寫成一串指令,我把它寫成一份資料檔:第幾秒放哪一支片、字幕什麼時候進、音效落在哪裡、音樂從哪裡淡出。

改一個數字,重跑一次,片子就重出一支。

從一首歌到一支成片,中間沒有再開任何一個剪輯軟體。

這件事在一個月前,我不會相信自己做得到。

免費的死路

一開始我不想花錢。

我在 Kaggle 的免費 T4 顯卡上跑開源的 Wan 2.2 TI2V-5B,一顆鏡頭要二十分鐘。

跑出來的東西有四種固定毛病:臉型會漂,車身顏色會變,桌上的咖啡豆會自己增生,車尾會糊出一塊霧。

我調了參數,調不動。那是模型的能力邊界。

換成付費模型之後,那四種毛病當場消失。

比價

換付費之後我沒有直接做,先做了一輪對照。

拿四張「我已知會失敗」的畫面,同樣的提示詞、同樣的參數,分別送進三個模型,並排放在一起看。

MiniMax H3 Max Turbo(768p,每秒 0.02 美金):動作量大而且合理,手跟器物的表現最好。遇到大面積緩慢流動的雲霧,它會自作主張改寫成一團翻湧的立體雲。

MiniMax H3 Max(1080p,每秒 0.08 美金):行為跟 Turbo 幾乎一樣。貴四倍,我沒看出四倍的差別。

Kling v3 Pro(每秒 0.112 美金):非常忠實、非常保守,畫面穩。磨豆機的曲柄會變形,整體偏靜,一支要跑快兩分鐘。

最後選了 Turbo。

這輪對照花了不到十塊美金,省掉的是後面整批重做。

如果你也要做這件事,我的建議是:先用你已知會失敗的素材做對照組,不要用最順的那張。

順的那張每一家都會過,看不出差別。

原來「手搖磨豆這個畫面」對 AI 來說是那麼的難以辨別。

通靈

有一個鏡頭,小獅妹嘴邊吐白煙。

我以為是模型亂加,準備換一家試試看。

回頭查提示詞才發現,是我自己寫了「呼出一小口白氣」。

三個模型都照做了。換模型當然無解。

類似的事還有兩件。

第一件:我要一顆固定不動的廣角鏡頭,模型拍到一半自己切成特寫,結尾再切回來。九支裡有五支這樣。

解法是在提示詞最前面寫死:整支只有一個連續不中斷的鏡頭,從第一幀到最後一幀維持同樣的廣角構圖,不切鏡、不特寫、不插入鏡頭。同時把動作改寫成廣角看得見的大動作。

重寫之後,九支全部固定住了。

第二件:小獅妹喝咖啡這個動作,我做了三個版本都沒過。杯子會瞬移,或者畫面裡多出第二個杯子。

根因在那張第一幀。杯子被我擺在濾杯的另一側,離她的手太遠。

模型不會讓角色伸長手去拿,它會就近變一個出來。

所以現在我驗收第一幀的時候,會用手指在畫面上把每一個動作的路徑走一遍:她要拿的東西,是不是在她伸手可及的地方,中間有沒有別的東西擋住。

我必須把我要的效果講清楚,否則模型就通靈。

數字是對的,但是感受是錯的。

前面這些都是技術問題,都有解。

真正讓我停下來的是另一件事。

第一版我切了九顆鏡頭,每一顆兩到四秒,每一顆都寫「固定鏡位」。

組起來之後我從頭看了一遍。

鏡頭是死的,節奏是碎的,光是平的,沒有故事線。

每一格都對,合起來沒有人。

我把它重切成五顆鏡頭,每顆四到六秒,每顆的提示詞改成一個運鏡、一個主要動作、一句光線。後製再逐段調色,從清晨的冷藍走到暖金,加一點暗角。

同樣的素材,同樣的模型,同樣的費用。

差別在分鏡。

以及,

靈魂。

外包品味

我以為自己在創作,實際上我只是在下訂單,然後驗收規格。

規格都對,東西不好看。

因為我從來沒有決定過這支片子要好看在哪裡。我把那個決定,連同美感和品味,一起外包出去了。

這是我最近最大的失焦。

AI 讓我去做那些我原本做不到的事,這是真的。我不會畫圖,不會動畫,不會混音,今天這支片子確實存在。

它取代不了我的深度思考。

分鏡要幾顆、鏡頭怎麼動、光從哪裡來、哪一句歌詞配哪一個畫面?

這些是判斷,不是產能。

我把判斷丟出去,我就永遠只能產出垃圾。

一日三更

同一個毛病,這禮拜還發生在另一個地方。

九月十五號開始,大杯居的社群改成一天兩篇,早上七點、晚上七點。

九月十八號再加一格中午十二點,變成一日三更。

內容是這樣分的:早上講商品,中午發「小獅日報」,是咖啡產業的新聞編譯;晚上發「如何……」的教學長文。

排程表我一口氣排到九月三十號,四十篇。

小獅日報從 No.001 排到 No.012。晚上那格是「如何挑一支酵素水洗咖啡豆」「如何評估開一台行動咖啡車」「如何挑露營用的手沖器材」。

回頭看,這些題目是為了填格子生出來的。

沒有一篇是因為我想講才寫的。

每篇文章都是我發的。

每篇文章卻都與我無關。

九月十九號中午之後,這些文章全部停在草稿。九月十八號中午那篇發出去之後,我又把它撤下來。

我的心聲誠實。

「這些文章我根本不想看。」

哎,那就是 AI slop。量有了,格子填滿了,沒有一個讀者因為那些文章多認識大杯居一點。

這禮拜看過那些貼文的人,阿瑋真是抱歉了。

後面沒發的我都留在草稿裡,會一篇一篇重看,該砍的砍掉。

產出

只要跟價值觀有關的產出,就必須是自己的體會。那個沒辦法外包,也不需要堆量。

重複性的行政工作,AI 處理得非常好。訂單、對帳、排程、格式轉換,我現在幾乎不碰。

如果連我的決策都被取代,我很難在 AI 泛用的洪流裡保留人的氣息。

所以靜下來思考、跟人專注地對話、認真讀一本書,這些反而變得更重要。

我很清楚,不做把關、不做審核,一直倒出來的東西就是 AI slop。

網路上已經夠多了。我不想再多加一份。

我原先定位的大杯居創業策略

「一、流程必須是AI Native的」

今天加上一條

「二、但靈魂必須是 Human Native 的」

半成品

小獅妹很可愛,但 AI 感還是重。細節經不起放大。

我把它貼出來,是想分享這個過程本身。我學到哪裡、卡在哪裡、還差多遠。

這就是我「此時此刻」能力的邊界。

西元兩千年

東西太多了,多到便宜。

人親手做的那一份,反而變得稀有。

最近我把注意力放回很久以前的作品上。西元兩千年以前的,AI 出現以前的那些。

詩、歌、賽璐璐、錄影帶、油彩……

那些東西中間沒有任何一次是靠演算法幫忙的。每一筆都是某個人坐下來,一筆一筆做出來的。

現在看,真是無上珍寶。

這兩支簡直是我愛不釋手。

On Your Mark(1995,Studio Ghibli × CHAGE and ASKA)

《橫濱購物紀行》OP

阿瑋的AI SLOP

一支三十五秒,小獅妹在露營地磨豆、沖咖啡。

一支三分半,完整的〈有雲山歌〉。畫面是一顆固定長鏡頭,她在同一片草地上做了八件事,最後回到開頭。

這兩支影片都有些地方看起來超級怪的。

影像是 AI 生成的,歌是我自己的。

今天就是這樣了,明天繼續修。

這裡是慚愧滿滿的大杯居。

本文 2026-09-20 首發於本站。