← 文章

這兩個禮拜又搞了一些花活:製作吉祥物表情包、復刻即時轉錄和口說輸入來省點錢、把耳掛包做成捲動廣告

51張表情包
85% 月費省下
297格捲動影片
對話圖卡。這兩週又搞了一些花活。小獅妹:這次有三件喔!阿瑋:表情包、口說輸入、捲動廣告。

嗨,我是阿瑋 Vic。先看成品。

單人 45 張

左右滑動,點一張放大

小獅妹的表情包,單人 45 張。每一張都是全身演出,沒有一張在立正。

商品頁的捲動影片,這裡截一小段。

到耳掛包頁面自己捲捲看

上面是大杯居耳掛包的商品頁。往下捲,一包耳掛從包裝走到一杯咖啡;往上捲,畫面就倒帶回去。

還有一件看不到的。今天早上,我把用了一陣子的口說輸入工具 Typeless 移到垃圾桶。

它每個月要 30 美元。再加上會議錄音轉逐字稿的傳譯寶,兩樣訂閱一個月約 1,346 元。

這兩個禮拜,我和小獅妹把這兩樣都自己做了一份。

小獅妹是大杯居的吉祥物,也是我在電腦上用的 AI 數位助理,底層是 Anthropic 公司的 AI「Claude」。程式是她寫的,我負責說清楚要什麼樣子,再一項一項驗收。

我每兩週會和一位在海外當工程師的朋友聊一次近況。這篇是今晚要帶去的筆記,順手整理給您。

文中提到的會議與日記內容一律不公開,畫面都用示範資料。費用裡標「推估」的數字,是官方單價乘上我自己的用量算出來的,不是帳單。

第一件事|吉祥物表情包

先看成果:51 張表情包

對話圖卡。阿瑋:五十一張,都畫好了。小獅妹:每一張我都有在演!

這套表情包一共 51 張:小獅妹單人 45 張,加上她和我同框的雙人 6 張。用途是大杯居的 LINE 對話和社群貼文。

每一張都經過同一條流程:

  1. 先決定情境,例如「早安」「收到」「忙翻了」「沒喝咖啡會當機」。
  2. 每個情境寫一份表演腳本(下一章的「八維」)。
  3. 讓 AI 依腳本逐張畫出全身演出。
  4. 去背、在胸前合成大杯居的 Logo、加白邊。
  5. 我在一個選圖頁上逐張點「通過」或「重生」,附一句原因。

第一輪 47 張裡,我通過 33 張、退回 14 張。退回的原因很具體:微表情不夠明顯、手畫斷了、身體扭曲,還有一張單膝獻上咖啡豆,看起來太像求婚。

雙人 6 張

左右滑動,點一張放大

雙人 6 張。「又有新要求」那張,是小獅妹對我的真實心聲。

問題:AI 畫的人都在立正

對話圖卡。阿瑋:怎麼每張都在立正?小獅妹:你又沒叫我動……

第一批 10 張出來的時候,表情都對,但每一張都站得很直。雙腳併攏,身體正對鏡頭,像在拍證件照。

原因出在腳本。那時候每張只寫一種情緒,例如「早安」寫「剛醒的慵懶,轉成暖暖的笑」。AI 收到一種情緒,就畫一個最穩定、最對稱的姿勢來表達它。

貼圖在聊天室裡只有指甲大小。站得筆直的角色縮到那麼小,就只剩一個「人形」,看不出她在想什麼。

八維:一張表情寫成一場戲

對話圖卡。阿瑋:一張表情,寫八件事。小獅妹:像在寫一場戲。

八維是一份表演腳本的格式,每一張表情都要寫滿八項。我是從一支教 AI 影片「演技」的教學影片學來的,原本用在影片,我把它改寫成靜態插畫版。

維度寫什麼
1 格位鏡頭角度、構圖,人物在畫面哪裡
2 人物目的她這一格想做到什麼
3 情緒節拍情緒走到哪個位置:剛開始、最高點,或正在退
4 觸發哪一句話、哪個事件讓表情改變
5 臉部動作眉、眼、鼻翼、嘴角、下巴各在做什麼
6 目光與身體看哪裡,肩、手、重心怎麼放
7 氣息與停頓靜態圖用留白、汗滴、張嘴未出聲來表現
8 結束狀態這一格停在哪個瞬間

第 5 項還會附上 AU 編號。AU(動作單元)是心理學描述臉部肌肉動作的編碼,例如 AU12 是嘴角上揚。寫成編號,AI 比較不會自己發揮。

八項寫滿,一張貼圖就有了前因後果。AI 拿到的指令從「畫一個開心的女孩」,變成「她剛聽到一句話,正要做一個動作」。

雙層表演:表層與底層

對話圖卡。阿瑋:表面在笑,底下呢?小獅妹:還在跟睡意拔河。

八維寫滿之後,姿勢還是偏立正。真正的轉折,是把第 3 項「情緒節拍」拆成兩層。

表層是她想讓別人看到的情緒,底層是藏著、只從一個小地方漏出來的第二種感受。以「早安」為例:

項目單層版雙層版
情緒剛醒的慵懶,轉成暖暖的笑表層:暖暖的早安笑;底層:還在跟睡意拔河
臉兩眼瞇成彎月,閉口微笑一眼幾乎閉上、一眼半睜,單邊嘴角上揚,嘴裡還留著呵欠的尾巴
身體正面站好,雙腳併攏重心在一腳,另一腳踮起;頭歪向杯子,一邊肩膀微聳
結束狀態定格在捧杯瞇眼笑停在剛要啜第一口、眼睛還睜不開的瞬間

拖拉下面的滑桿,可以比較同一個情境的兩個版本:

小獅妹身體斜向一邊、一腳往前踏,雙手捧杯,一隻眼瞇起、嘴巴微張
小獅妹雙手捧著咖啡杯,兩腳併攏、正面站著,表情平靜微笑

左:兩腳併攏、雙手捧杯,正面站著。
右:身體斜向一邊、一腳往前踏,一隻眼瞇起來,嘴巴微張,裙擺跟著晃。

左右拖曳中間的圓鈕;用鍵盤時,按左右鍵調整。

同一批 10 個情境,各用單層和雙層腳本畫一輪。單層版多半立正、雙腳並排;雙層版 10 張全部出現重心偏移,也都看得出第二層情緒。我看完的第一句話是「超可愛到爆裂」。

雙層表演整理成幾條寫法,之後每一張都照著寫:

  • 臉不對稱:一眉高一眉低、單邊嘴角、兩眼狀態不同。底層情緒就從這裡漏出來。
  • 視線有對象:偷瞄、往上看、從杯緣上方看,多半不看鏡頭。
  • 身體有斜線:重心放一腳,肩和胯往反方向傾,整體是一條 S 曲線。
  • 停在動作中途:點頭點到一半、揮手揮到一半,不停在最穩的那一格。
  • 另附英文表演說明:同一場戲用英文再寫一次。生圖模型對中文細節的權重比較低。

第二件事|自己做口說輸入和會議記錄

兩個很貴的工具

對話圖卡。阿瑋:兩樣加起來,一個月一千三。小獅妹:那是好幾包豆子耶!

這兩個工具都很好用,好用到我每天都在用,也每個月都在付錢。

工具做什麼我付的方案
Typeless按著快捷鍵說話,放開後,整理好的文字直接出現在游標的位置。贅字、口頭禪、說錯改口都會自動清掉Pro 月繳 US$30
傳譯寶手機錄下整場會議,轉成逐字稿、摘要和待辦專業帳號月繳 NT$390

我用它們的場景有四個:

  1. 跟 AI 下指令都用說的。我的口述紀錄裡,110 則有 108 則是說給 Claude 聽的。打字太慢,說話剛好。
  2. 會議結束後的紀錄。以前是錄音、複製逐字稿、再貼進行事曆的備註欄,每場都要手動做一次。
  3. 手機上寫日記。邊走邊說,一說就是好幾分鐘。
  4. 上課、聽講座、開車時的學習筆記。課程裡的專有名詞很多,例如佛學課的經名和名相。

四個場景加起來,其實是同一件事:把聲音變成整理好的文字,放到它該去的地方。差別只在入口和終點。

架構:三個入口,一個後端

對話圖卡。小獅妹:三個入口,同一間廚房。阿瑋:聲音都送到同一個地方。

想通「入口不同、處理相同」之後,架構就很簡單了。三個入口,共用同一個後端。點左邊的入口,可以看聲音走哪一條路:

三個入口共用同一個雲端後端。點上面的入口,看聲音的光點走哪條路;我改過的字會自動學成詞,下次轉錄就更準。

三個入口分別是:

  • Mac 口說輸入:選單列上的小程式。按一下 fn 開始說,再按一下結束,文字打進游標所在的地方。
  • iPhone 口說鍵盤:做在大杯居 App 裡的鍵盤,任何 App 都能切出來用。今天把單次上限從 2 分鐘拉到 30 分鐘,長篇日記也說得完。
  • 會議記錄 App:iPhone 錄整場會議,邊錄邊分段上傳。會議結束後幾分鐘,摘要寫進行事曆對應的那一場,完整逐字稿和錄音同步回 Mac 的資料夾。

後端用的是 Cloudflare Worker(放在雲端、收到請求才執行的小程式),錄音檔、紀錄和詞庫也都放在 Cloudflare。真正「聽」和「整理」的工作,交給 OpenAI 的語音轉文字和語言模型。

共用後端有兩個好處。第一,花錢的地方只有一個,用多少付多少。第二,三個入口共用同一本詞庫,在 Mac 上教會的詞,手機也會。

實際用起來長這樣

下面是在我的 Mac 上實際錄的。為了不放真實內容,我寫了一段示範稿,用電腦語音念給麥克風聽,口頭禪和改口都是故意放進去的。

Mac:按一下 fn 說話,再按一下結束。「九點喔不對是十點」變成「10 點」,「然後然後」只留一次。「手衝壺」是聽錯的,正確是「手沖壺」;同一個字改過兩次,它就會記住。

先量再做:盲評與 2.5 秒

對話圖卡。阿瑋:先盲評,再動手。小獅妹:十段要過七段喔。

動手寫程式之前,我先定了兩條及格線。過不了就不做,繼續付錢。

品質:10 段真實錄音,7 段要能用

我從自己的錄音裡剪了 10 段,有日記、車上的學習筆記、課程錄音、閒聊。小獅妹把每一段跑過轉錄和整理,我不看是哪個設定,直接評分:

  • A:可以直接用。
  • B:改一兩個字就能用。
  • C:不能用。

結果 A 3 段、B 4 段、C 2 段,A 加 B 剛好 7 段,過關。兩段 C,一段整段只有口頭禪,一段是多人閒聊。

速度:放開按鍵到第一個字,2.5 秒內

口說輸入的手感,取決於說完之後要等多久。我把門檻定在「放開按鍵到第一個字出現」2.5 秒以內。

第一次實測,等待時間的中位數是 6.1 秒,差得很遠。後來做了三件事:

  1. 先連好線:按下按鍵時就先和伺服器連線,說完不用再等連線。
  2. 邊說邊送:長口述在明顯的停頓處切段,前面的段落先轉,說完只剩最後一段要等。
  3. 邊整理邊打字:整理好的文字一個字一個字送回來,不等全文完成。

改完之後,測試環境下第一個字出現約 2.2 秒,全文完成約 3.1 秒(Mac、家用網路、10 段樣本)。

日常實際使用,後端記到的 34 則口述,第一個字平均 2.8 秒,還差一點點。手感已經接近 Typeless,剩下的 0.3 秒留給下一輪。

會學詞:越用越聽得懂

對話圖卡。小獅妹:這個字你改過兩次了。阿瑋:那就記起來吧。小獅妹:記住了!

語音轉文字最常錯的,是只有自己會用的詞:人名、地名、課程名、店裡的品項。

做法是在轉錄時附上一份「熱詞」清單,告訴模型這些詞會出現。清單要多謹慎,實測給了我兩次教訓:

  • 熱詞加太多,反而把對的聽成錯的:「九十度」變「十字」,「佛塔」變「佛陀」。
  • 我把一個地名在清單裡寫錯了,結果每次都被「糾正」成錯的寫法。

所以清單只放我確認過的詞,而且讓它自己長。

  1. 口說輸入貼出文字後,記住貼在哪裡。
  2. 我手動改了其中的字,系統比對改前改後。
  3. 同一組錯字我改過兩次,就自動加進詞庫。
  4. 聽起來一樣、字卻常寫錯的詞,另外記成對照表,整理時一併修正。

詞庫放在後端,Mac 和 iPhone 共用。我說得越多,它錯得越少。

算帳:一個月省多少

對話圖卡。阿瑋:一個月剩兩百左右。小獅妹:省下來的拿去買豆子!

原本每月訂閱

/ 月

    自己做的每月成本(推估)

    / 月

      先講結論:原本兩樣訂閱一個月約 NT$1,346;自己做的版本,依我的用量推估,一個月約 NT$204,少了大約八成五。一年算下來約省 NT$1.4 萬。

      原本的訂閱

      項目每月
      Typeless Pro(月繳)US$30,約 NT$956
      傳譯寶 專業帳號(月繳)NT$390
      合計約 NT$1,346

      自己做的版本(推估)

      自己做的版本沒有月費,用多少付多少。我拿官方單價,乘上自己的實際用量:

      • 會議:9 月 8 日到 10 月 10 日一共錄了約 484 分鐘、33 場,換算一個月約 450 分鐘、30 場。
      • 口說輸入:後端從 10 月 8 日開始記錄,兩天約 11 分鐘,抓寬一點算一個月 170 分鐘。
      項目官方單價每月用量每月
      會議轉錄US$0.0045/分鐘450 分鐘US$2.0
      會議說話者標記約 US$0.006/分鐘450 分鐘US$2.7
      會議摘要輸入 US$2、輸出 US$12(每百萬 token)30 場約 US$0.8
      口說輸入轉錄US$0.0045/分鐘170 分鐘US$0.8
      口說整理輸入 US$0.10、輸出 US$0.50(每百萬 token)同上不到 US$0.1
      Cloudflare官網原本就在付的方案在額度內不另外加
      合計約 US$6.4,約 NT$204

      匯率以中央銀行公布的 10 月 8 日新臺幣對美元收盤價 31.875 計算。token 是語言模型計價的單位,一個中文字約一到兩個 token。摘要與整理的費用依每場、每則的平均長度估算。

      能省這麼多,是因為我的用量小。傳譯寶的月費含每月 3,000 分鐘,我一個月只用了 450 分鐘左右;用量如果大上好幾倍,月費方案反而划算。

      今天 Typeless 移進垃圾桶之後,我讓小獅妹每週一晚上自動比對一次它的更新紀錄。有新功能才問我要不要跟上。它一直是很好的老師。

      第三件事|耳掛包捲動廣告

      從 3D 到 AI 影片

      對話圖卡。阿瑋:3D 太像遊戲了。小獅妹:那我改拍成影片。

      我想在商品頁做一種展示:往下捲,商品跟著轉、跟著拆開,像蘋果官網那樣。

      第一版是 3D。小獅妹用網頁 3D 技術做了一個耳掛包的模型,貼上真實的包裝標籤,捲動時跟著轉。技術上做成了,我看完說:「太像遊戲了。」

      第二版改成 AI 影片,步驟如下:

      1. 先查沖法:耳掛怎麼泡,查了四個品牌的官方說明,整理成步驟。
      2. 出分鏡:小獅妹提了五個分鏡方案,我在一個表態頁上選了「一路往下」那一案。
      3. 畫停格:五張 AI 停格圖,從包裝、撕開、掛上杯子、注水,到一杯咖啡。
      4. 補轉場:把相鄰兩張停格當成第一格和最後一格,讓影片模型補出中間約 2.6 秒的動作。這叫「首尾幀」生成。
      5. 接成一支:五段轉場接起來,一共 297 格。

      影片生成的費用,累計約 1.8 美元。

      捲動就是播放頭

      對話圖卡。小獅妹:往下捲,咖啡就沖好。阿瑋:往上捲,就倒帶。

      整個效果的原理只有一句:捲軸捲到哪裡,影片就跳到哪一格。往下捲是播放,往上捲是倒帶。

      做起來有幾個細節:

      • 倒帶要順:一般影片為了省空間,大多只記錄「這一格和前一格差在哪裡」。要倒帶,就得從最近的一張完整畫面重算。所以這支影片每 8 格放一張完整畫面,檔案大一點(約 3.7 MB),換來往回捲也順。
      • 快滑不跳段:手指一滑可能直接跨過好幾段。播放頭會用 2.5 到 6 倍速追上去,畫面依序播過,不會直接跳到結尾。
      • 停下來也有呼吸:手停住時,換上高畫質的停格圖,整個畫面以 6.5 秒一次的節奏微微放大、縮回。
      • 尊重使用者設定:手機開了「減少動態效果」或省流量模式,就只換停格圖,不播影片。

      商城的商品卡片上,我也試過放循環短片,看了幾版之後,還是改回靜態的封面。會動的東西放在商品頁一個地方就夠了。

      想自己捲捲看,耳掛包的頁面在這裡:

      到耳掛包頁面捲捲看

      三件事的共同點

      對話圖卡。阿瑋:三件事的共同點?小獅妹:先說清楚要什麼樣子。

      表情包、口說輸入、捲動廣告,三件事差很多。回頭看,做法有三個共同點。

      先把「想要的樣子」寫成可以檢查的標準

      「表情要生動」沒辦法驗收,「重心在一腳、臉不對稱、停在動作中途」可以。「要快」沒辦法驗收,「第一個字 2.5 秒內」可以。標準寫得越具體,AI 越不會自由發揮。

      用真實素材先量

      口說輸入用我自己的 10 段錄音盲評,捲動廣告先在手機、平板、電腦三種寬度上測過。用示範資料測,永遠會過。

      量大的交給 AI,判斷留給自己

      51 張表情是 AI 畫的,通過哪一張是我點的。程式是小獅妹寫的,分鏡選哪一案、3D 要不要繼續,是我決定的。我花的時間,幾乎都花在「看」和「選」。

      常見問題

      關於自己做工具

      Q:完全不會寫程式,做得出來嗎?

      程式碼都是小獅妹寫的,我沒有自己寫。但過程中要能看懂錯誤、願意照步驟處理卡關,例如 iPhone App 的簽章、網站的部署。做 iPhone App 需要一台 Mac。

      Q:為什麼不繼續用現成的就好?

      現成的工具很好,如果用量大、又需要跨很多平台,我會繼續付。我自己做,是因為三件事要接在一起:詞庫要共用,會議要直接寫進行事曆,日記要寫進大杯居 App。加上我的用量不大,按用量付費比月費便宜很多。

      Q:自己做的,準確度跟 Typeless 比起來如何?

      我沒有做嚴格的同場比較。我能說的是:10 段真實錄音盲評,7 段可直接用或小修就能用;日常使用的手感接近。Typeless 支援的平台和語言比我做的多很多。

      關於資料與安全

      Q:錄音和文字放在哪裡?

      放在我自己的 Cloudflare 帳號。口述的原始文字 90 天後自動刪除,只留下詞庫。轉錄和整理時,聲音和文字會送到 OpenAI 的 API 處理。依 OpenAI 的說明,送到 API 的資料預設不會拿去訓練模型,濫用監控紀錄最多保留 30 天。

      Q:會議錄音裡有別人的聲音,可以這樣處理嗎?

      錄音前先取得與會者同意比較妥當。公司會議能不能錄、能不能送到雲端處理,請先確認所屬單位的規範。

      關於表情包與捲動廣告

      Q:表情包是用什麼畫的?要花錢嗎?

      用 OpenAI 的 Codex 生圖功能,算在我原本的 ChatGPT 訂閱額度裡,沒有另外付費。實測一張約用掉五小時額度的 1%。退回重畫的也算在裡面。

      Q:捲動影片會不會很耗流量?

      影片約 3.7 MB,比一張高解析照片大一些。手機開了省流量模式,頁面只載入停格圖,不載影片。

      最後

      垃圾桶裡的 Typeless 還沒清。

      它教會我很多事:說話比打字快,贅字可以交給機器,好的工具會讓人忘記它在那裡。

      這篇文章的需求,也是我用口說輸入說給小獅妹聽的。「去識別化」被聽成了「去世別話」,這個詞大概很快就會進詞庫。

      花活搞完,日子還是要過。省下來的錢,拿去買好一點的咖啡豆。

      逛逛大杯居的咖啡

      阿瑋 記於 2026 年 10 月

      八維表演的寫法,改寫自 Foyege 的 AI 演技教學影片,謝謝無私分享。

      參考來源(2026 年 10 月 10 日查證)

      1. API Pricing|OpenAI
      2. gpt-5.6-terra|OpenAI Models
      3. Data controls in the OpenAI platform|OpenAI
      4. Pricing|Typeless
      5. AI會議記錄 - 傳譯寶|App Store
      6. 傳譯寶 方案頁|IDEANOLOGY LTD
      7. Workers Pricing|Cloudflare Docs
      8. MiniMax H3 Max Turbo Image to Video|fal
      9. 新臺幣對美元銀行間成交之收盤匯率|中央銀行
      10. AI 演技喂飯級教程|Foyege(YouTube)
      插圖人物:阿瑋與小獅妹(角色為 AI 生成)。文中會議、日記內容不公開,畫面為示範資料。

      本文 2026-10-10 首發於本站。