嗨,我是阿瑋 Vic。先看成品。
單人 45 張
左右滑動,點一張放大
小獅妹的表情包,單人 45 張。每一張都是全身演出,沒有一張在立正。
上面是大杯居耳掛包的商品頁。往下捲,一包耳掛從包裝走到一杯咖啡;往上捲,畫面就倒帶回去。
還有一件看不到的。今天早上,我把用了一陣子的口說輸入工具 Typeless 移到垃圾桶。
它每個月要 30 美元。再加上會議錄音轉逐字稿的傳譯寶,兩樣訂閱一個月約 1,346 元。
這兩個禮拜,我和小獅妹把這兩樣都自己做了一份。
小獅妹是大杯居的吉祥物,也是我在電腦上用的 AI 數位助理,底層是 Anthropic 公司的 AI「Claude」。程式是她寫的,我負責說清楚要什麼樣子,再一項一項驗收。
我每兩週會和一位在海外當工程師的朋友聊一次近況。這篇是今晚要帶去的筆記,順手整理給您。
文中提到的會議與日記內容一律不公開,畫面都用示範資料。費用裡標「推估」的數字,是官方單價乘上我自己的用量算出來的,不是帳單。
第一件事|吉祥物表情包
先看成果:51 張表情包
這套表情包一共 51 張:小獅妹單人 45 張,加上她和我同框的雙人 6 張。用途是大杯居的 LINE 對話和社群貼文。
每一張都經過同一條流程:
- 先決定情境,例如「早安」「收到」「忙翻了」「沒喝咖啡會當機」。
- 每個情境寫一份表演腳本(下一章的「八維」)。
- 讓 AI 依腳本逐張畫出全身演出。
- 去背、在胸前合成大杯居的 Logo、加白邊。
- 我在一個選圖頁上逐張點「通過」或「重生」,附一句原因。
第一輪 47 張裡,我通過 33 張、退回 14 張。退回的原因很具體:微表情不夠明顯、手畫斷了、身體扭曲,還有一張單膝獻上咖啡豆,看起來太像求婚。
雙人 6 張
左右滑動,點一張放大
雙人 6 張。「又有新要求」那張,是小獅妹對我的真實心聲。
問題:AI 畫的人都在立正
第一批 10 張出來的時候,表情都對,但每一張都站得很直。雙腳併攏,身體正對鏡頭,像在拍證件照。
原因出在腳本。那時候每張只寫一種情緒,例如「早安」寫「剛醒的慵懶,轉成暖暖的笑」。AI 收到一種情緒,就畫一個最穩定、最對稱的姿勢來表達它。
貼圖在聊天室裡只有指甲大小。站得筆直的角色縮到那麼小,就只剩一個「人形」,看不出她在想什麼。
八維:一張表情寫成一場戲
八維是一份表演腳本的格式,每一張表情都要寫滿八項。我是從一支教 AI 影片「演技」的教學影片學來的,原本用在影片,我把它改寫成靜態插畫版。
| 維度 | 寫什麼 |
|---|---|
| 1 格位 | 鏡頭角度、構圖,人物在畫面哪裡 |
| 2 人物目的 | 她這一格想做到什麼 |
| 3 情緒節拍 | 情緒走到哪個位置:剛開始、最高點,或正在退 |
| 4 觸發 | 哪一句話、哪個事件讓表情改變 |
| 5 臉部動作 | 眉、眼、鼻翼、嘴角、下巴各在做什麼 |
| 6 目光與身體 | 看哪裡,肩、手、重心怎麼放 |
| 7 氣息與停頓 | 靜態圖用留白、汗滴、張嘴未出聲來表現 |
| 8 結束狀態 | 這一格停在哪個瞬間 |
第 5 項還會附上 AU 編號。AU(動作單元)是心理學描述臉部肌肉動作的編碼,例如 AU12 是嘴角上揚。寫成編號,AI 比較不會自己發揮。
八項寫滿,一張貼圖就有了前因後果。AI 拿到的指令從「畫一個開心的女孩」,變成「她剛聽到一句話,正要做一個動作」。
雙層表演:表層與底層
八維寫滿之後,姿勢還是偏立正。真正的轉折,是把第 3 項「情緒節拍」拆成兩層。
表層是她想讓別人看到的情緒,底層是藏著、只從一個小地方漏出來的第二種感受。以「早安」為例:
| 項目 | 單層版 | 雙層版 |
|---|---|---|
| 情緒 | 剛醒的慵懶,轉成暖暖的笑 | 表層:暖暖的早安笑;底層:還在跟睡意拔河 |
| 臉 | 兩眼瞇成彎月,閉口微笑 | 一眼幾乎閉上、一眼半睜,單邊嘴角上揚,嘴裡還留著呵欠的尾巴 |
| 身體 | 正面站好,雙腳併攏 | 重心在一腳,另一腳踮起;頭歪向杯子,一邊肩膀微聳 |
| 結束狀態 | 定格在捧杯瞇眼笑 | 停在剛要啜第一口、眼睛還睜不開的瞬間 |
拖拉下面的滑桿,可以比較同一個情境的兩個版本:


左:兩腳併攏、雙手捧杯,正面站著。
右:身體斜向一邊、一腳往前踏,一隻眼瞇起來,嘴巴微張,裙擺跟著晃。
左右拖曳中間的圓鈕;用鍵盤時,按左右鍵調整。
同一批 10 個情境,各用單層和雙層腳本畫一輪。單層版多半立正、雙腳並排;雙層版 10 張全部出現重心偏移,也都看得出第二層情緒。我看完的第一句話是「超可愛到爆裂」。
雙層表演整理成幾條寫法,之後每一張都照著寫:
- 臉不對稱:一眉高一眉低、單邊嘴角、兩眼狀態不同。底層情緒就從這裡漏出來。
- 視線有對象:偷瞄、往上看、從杯緣上方看,多半不看鏡頭。
- 身體有斜線:重心放一腳,肩和胯往反方向傾,整體是一條 S 曲線。
- 停在動作中途:點頭點到一半、揮手揮到一半,不停在最穩的那一格。
- 另附英文表演說明:同一場戲用英文再寫一次。生圖模型對中文細節的權重比較低。
第二件事|自己做口說輸入和會議記錄
兩個很貴的工具
這兩個工具都很好用,好用到我每天都在用,也每個月都在付錢。
| 工具 | 做什麼 | 我付的方案 |
|---|---|---|
| Typeless | 按著快捷鍵說話,放開後,整理好的文字直接出現在游標的位置。贅字、口頭禪、說錯改口都會自動清掉 | Pro 月繳 US$30 |
| 傳譯寶 | 手機錄下整場會議,轉成逐字稿、摘要和待辦 | 專業帳號月繳 NT$390 |
我用它們的場景有四個:
- 跟 AI 下指令都用說的。我的口述紀錄裡,110 則有 108 則是說給 Claude 聽的。打字太慢,說話剛好。
- 會議結束後的紀錄。以前是錄音、複製逐字稿、再貼進行事曆的備註欄,每場都要手動做一次。
- 手機上寫日記。邊走邊說,一說就是好幾分鐘。
- 上課、聽講座、開車時的學習筆記。課程裡的專有名詞很多,例如佛學課的經名和名相。
四個場景加起來,其實是同一件事:把聲音變成整理好的文字,放到它該去的地方。差別只在入口和終點。
架構:三個入口,一個後端
想通「入口不同、處理相同」之後,架構就很簡單了。三個入口,共用同一個後端。點左邊的入口,可以看聲音走哪一條路:
三個入口分別是:
- Mac 口說輸入:選單列上的小程式。按一下 fn 開始說,再按一下結束,文字打進游標所在的地方。
- iPhone 口說鍵盤:做在大杯居 App 裡的鍵盤,任何 App 都能切出來用。今天把單次上限從 2 分鐘拉到 30 分鐘,長篇日記也說得完。
- 會議記錄 App:iPhone 錄整場會議,邊錄邊分段上傳。會議結束後幾分鐘,摘要寫進行事曆對應的那一場,完整逐字稿和錄音同步回 Mac 的資料夾。
後端用的是 Cloudflare Worker(放在雲端、收到請求才執行的小程式),錄音檔、紀錄和詞庫也都放在 Cloudflare。真正「聽」和「整理」的工作,交給 OpenAI 的語音轉文字和語言模型。
共用後端有兩個好處。第一,花錢的地方只有一個,用多少付多少。第二,三個入口共用同一本詞庫,在 Mac 上教會的詞,手機也會。
實際用起來長這樣
下面是在我的 Mac 上實際錄的。為了不放真實內容,我寫了一段示範稿,用電腦語音念給麥克風聽,口頭禪和改口都是故意放進去的。
先量再做:盲評與 2.5 秒
動手寫程式之前,我先定了兩條及格線。過不了就不做,繼續付錢。
品質:10 段真實錄音,7 段要能用
我從自己的錄音裡剪了 10 段,有日記、車上的學習筆記、課程錄音、閒聊。小獅妹把每一段跑過轉錄和整理,我不看是哪個設定,直接評分:
- A:可以直接用。
- B:改一兩個字就能用。
- C:不能用。
結果 A 3 段、B 4 段、C 2 段,A 加 B 剛好 7 段,過關。兩段 C,一段整段只有口頭禪,一段是多人閒聊。
速度:放開按鍵到第一個字,2.5 秒內
口說輸入的手感,取決於說完之後要等多久。我把門檻定在「放開按鍵到第一個字出現」2.5 秒以內。
第一次實測,等待時間的中位數是 6.1 秒,差得很遠。後來做了三件事:
- 先連好線:按下按鍵時就先和伺服器連線,說完不用再等連線。
- 邊說邊送:長口述在明顯的停頓處切段,前面的段落先轉,說完只剩最後一段要等。
- 邊整理邊打字:整理好的文字一個字一個字送回來,不等全文完成。
改完之後,測試環境下第一個字出現約 2.2 秒,全文完成約 3.1 秒(Mac、家用網路、10 段樣本)。
日常實際使用,後端記到的 34 則口述,第一個字平均 2.8 秒,還差一點點。手感已經接近 Typeless,剩下的 0.3 秒留給下一輪。
會學詞:越用越聽得懂
語音轉文字最常錯的,是只有自己會用的詞:人名、地名、課程名、店裡的品項。
做法是在轉錄時附上一份「熱詞」清單,告訴模型這些詞會出現。清單要多謹慎,實測給了我兩次教訓:
- 熱詞加太多,反而把對的聽成錯的:「九十度」變「十字」,「佛塔」變「佛陀」。
- 我把一個地名在清單裡寫錯了,結果每次都被「糾正」成錯的寫法。
所以清單只放我確認過的詞,而且讓它自己長。
- 口說輸入貼出文字後,記住貼在哪裡。
- 我手動改了其中的字,系統比對改前改後。
- 同一組錯字我改過兩次,就自動加進詞庫。
- 聽起來一樣、字卻常寫錯的詞,另外記成對照表,整理時一併修正。
詞庫放在後端,Mac 和 iPhone 共用。我說得越多,它錯得越少。
算帳:一個月省多少
原本每月訂閱
/ 月
自己做的每月成本(推估)
/ 月
先講結論:原本兩樣訂閱一個月約 NT$1,346;自己做的版本,依我的用量推估,一個月約 NT$204,少了大約八成五。一年算下來約省 NT$1.4 萬。
原本的訂閱
| 項目 | 每月 |
|---|---|
| Typeless Pro(月繳) | US$30,約 NT$956 |
| 傳譯寶 專業帳號(月繳) | NT$390 |
| 合計 | 約 NT$1,346 |
自己做的版本(推估)
自己做的版本沒有月費,用多少付多少。我拿官方單價,乘上自己的實際用量:
- 會議:9 月 8 日到 10 月 10 日一共錄了約 484 分鐘、33 場,換算一個月約 450 分鐘、30 場。
- 口說輸入:後端從 10 月 8 日開始記錄,兩天約 11 分鐘,抓寬一點算一個月 170 分鐘。
| 項目 | 官方單價 | 每月用量 | 每月 |
|---|---|---|---|
| 會議轉錄 | US$0.0045/分鐘 | 450 分鐘 | US$2.0 |
| 會議說話者標記 | 約 US$0.006/分鐘 | 450 分鐘 | US$2.7 |
| 會議摘要 | 輸入 US$2、輸出 US$12(每百萬 token) | 30 場 | 約 US$0.8 |
| 口說輸入轉錄 | US$0.0045/分鐘 | 170 分鐘 | US$0.8 |
| 口說整理 | 輸入 US$0.10、輸出 US$0.50(每百萬 token) | 同上 | 不到 US$0.1 |
| Cloudflare | 官網原本就在付的方案 | 在額度內 | 不另外加 |
| 合計 | 約 US$6.4,約 NT$204 |
匯率以中央銀行公布的 10 月 8 日新臺幣對美元收盤價 31.875 計算。token 是語言模型計價的單位,一個中文字約一到兩個 token。摘要與整理的費用依每場、每則的平均長度估算。
能省這麼多,是因為我的用量小。傳譯寶的月費含每月 3,000 分鐘,我一個月只用了 450 分鐘左右;用量如果大上好幾倍,月費方案反而划算。
今天 Typeless 移進垃圾桶之後,我讓小獅妹每週一晚上自動比對一次它的更新紀錄。有新功能才問我要不要跟上。它一直是很好的老師。
第三件事|耳掛包捲動廣告
從 3D 到 AI 影片
我想在商品頁做一種展示:往下捲,商品跟著轉、跟著拆開,像蘋果官網那樣。
第一版是 3D。小獅妹用網頁 3D 技術做了一個耳掛包的模型,貼上真實的包裝標籤,捲動時跟著轉。技術上做成了,我看完說:「太像遊戲了。」
第二版改成 AI 影片,步驟如下:
- 先查沖法:耳掛怎麼泡,查了四個品牌的官方說明,整理成步驟。
- 出分鏡:小獅妹提了五個分鏡方案,我在一個表態頁上選了「一路往下」那一案。
- 畫停格:五張 AI 停格圖,從包裝、撕開、掛上杯子、注水,到一杯咖啡。
- 補轉場:把相鄰兩張停格當成第一格和最後一格,讓影片模型補出中間約 2.6 秒的動作。這叫「首尾幀」生成。
- 接成一支:五段轉場接起來,一共 297 格。
影片生成的費用,累計約 1.8 美元。
捲動就是播放頭
整個效果的原理只有一句:捲軸捲到哪裡,影片就跳到哪一格。往下捲是播放,往上捲是倒帶。
做起來有幾個細節:
- 倒帶要順:一般影片為了省空間,大多只記錄「這一格和前一格差在哪裡」。要倒帶,就得從最近的一張完整畫面重算。所以這支影片每 8 格放一張完整畫面,檔案大一點(約 3.7 MB),換來往回捲也順。
- 快滑不跳段:手指一滑可能直接跨過好幾段。播放頭會用 2.5 到 6 倍速追上去,畫面依序播過,不會直接跳到結尾。
- 停下來也有呼吸:手停住時,換上高畫質的停格圖,整個畫面以 6.5 秒一次的節奏微微放大、縮回。
- 尊重使用者設定:手機開了「減少動態效果」或省流量模式,就只換停格圖,不播影片。
商城的商品卡片上,我也試過放循環短片,看了幾版之後,還是改回靜態的封面。會動的東西放在商品頁一個地方就夠了。
想自己捲捲看,耳掛包的頁面在這裡:
三件事的共同點
表情包、口說輸入、捲動廣告,三件事差很多。回頭看,做法有三個共同點。
先把「想要的樣子」寫成可以檢查的標準
「表情要生動」沒辦法驗收,「重心在一腳、臉不對稱、停在動作中途」可以。「要快」沒辦法驗收,「第一個字 2.5 秒內」可以。標準寫得越具體,AI 越不會自由發揮。
用真實素材先量
口說輸入用我自己的 10 段錄音盲評,捲動廣告先在手機、平板、電腦三種寬度上測過。用示範資料測,永遠會過。
量大的交給 AI,判斷留給自己
51 張表情是 AI 畫的,通過哪一張是我點的。程式是小獅妹寫的,分鏡選哪一案、3D 要不要繼續,是我決定的。我花的時間,幾乎都花在「看」和「選」。
常見問題
關於自己做工具
Q:完全不會寫程式,做得出來嗎?
程式碼都是小獅妹寫的,我沒有自己寫。但過程中要能看懂錯誤、願意照步驟處理卡關,例如 iPhone App 的簽章、網站的部署。做 iPhone App 需要一台 Mac。
Q:為什麼不繼續用現成的就好?
現成的工具很好,如果用量大、又需要跨很多平台,我會繼續付。我自己做,是因為三件事要接在一起:詞庫要共用,會議要直接寫進行事曆,日記要寫進大杯居 App。加上我的用量不大,按用量付費比月費便宜很多。
Q:自己做的,準確度跟 Typeless 比起來如何?
我沒有做嚴格的同場比較。我能說的是:10 段真實錄音盲評,7 段可直接用或小修就能用;日常使用的手感接近。Typeless 支援的平台和語言比我做的多很多。
關於資料與安全
Q:錄音和文字放在哪裡?
放在我自己的 Cloudflare 帳號。口述的原始文字 90 天後自動刪除,只留下詞庫。轉錄和整理時,聲音和文字會送到 OpenAI 的 API 處理。依 OpenAI 的說明,送到 API 的資料預設不會拿去訓練模型,濫用監控紀錄最多保留 30 天。
Q:會議錄音裡有別人的聲音,可以這樣處理嗎?
錄音前先取得與會者同意比較妥當。公司會議能不能錄、能不能送到雲端處理,請先確認所屬單位的規範。
關於表情包與捲動廣告
Q:表情包是用什麼畫的?要花錢嗎?
用 OpenAI 的 Codex 生圖功能,算在我原本的 ChatGPT 訂閱額度裡,沒有另外付費。實測一張約用掉五小時額度的 1%。退回重畫的也算在裡面。
Q:捲動影片會不會很耗流量?
影片約 3.7 MB,比一張高解析照片大一些。手機開了省流量模式,頁面只載入停格圖,不載影片。
最後
垃圾桶裡的 Typeless 還沒清。
它教會我很多事:說話比打字快,贅字可以交給機器,好的工具會讓人忘記它在那裡。
這篇文章的需求,也是我用口說輸入說給小獅妹聽的。「去識別化」被聽成了「去世別話」,這個詞大概很快就會進詞庫。
花活搞完,日子還是要過。省下來的錢,拿去買好一點的咖啡豆。
阿瑋 記於 2026 年 10 月
八維表演的寫法,改寫自 Foyege 的 AI 演技教學影片,謝謝無私分享。