第 3 章
配音
黃志弘 Leo
跟 AI 一起做東西的筆記
配音在流程中的位置
配音要在做畫面之前完成。每一格畫面出現的時間、字幕換行的時間,都照聲音檔裡每一句的時間點排列;聲音一改,畫面就要重排。
這支片的配音我用 Google 的 Gemini 語音模型(gemini-3.8-flash-tts),聲音選 Charon。從第一版到定稿,聲音檔一共改了三輪:
| 版本 | 改了什麼 | 旁白長度 |
|---|---|---|
| v1 | 整份旁白一次合成 | 16 句 61.8 秒 |
| v2 | 在指令裡要求更快、更有精神 | 同樣 16 句 53.2 秒,加上新的第 17 句共 56.85 秒 |
| v3 | 不重錄,直接把句子之間的空白剪短 | 17 句 49.37 秒 |