• AI 配音
  • AI 旁白

如何使用 CapCut 為 YouTube 加入 AI 配音

YouTube AI 配音:預覽腳本、確認使用權利、匯出 MP3,再於 CapCut 先剪音訊。依流程比較內建 TTS 與匯入檔案。

TextSpeech 團隊8 分鐘閱讀
桌面上的檯燈、耳機,以及顯示音訊時間軸的螢幕

簡短答案: AI 配音(也稱 AI 旁白)會將腳本轉成旁白。以聽覺體驗撰寫、預覽一段、確認商業權利、匯出 MP3,再於 CapCut 先剪音訊。內建 TTS 也可能適合系列;選擇前請比較聲音供應、匯出選項與現行條款。

AI 配音與 AI 旁白是同一種工作。依照重複使用與剪輯控制需求,選擇編輯器內建聲音或獨立音訊檔。

最後更新:2026 年 9 月 14 日。 資料查核:於 2026 年 9 月 14 日查閱 YouTube 官方揭露與營利文件。聲音選擇與剪輯步驟是建議,不是試聽測試、留存實驗或登入帳號上傳測試的結果。

AI 配音、YouTube TTS 與 CapCut TTS 比較

來源是什麼適合不擅長
AI 配音/AI 旁白(瀏覽器工作室)腳本 → 預覽 → MP3固定系列主持聲音、商業授權、下週沿用同一聲音確認所選聲音的重複使用與匯出條款
YouTube TTS/YouTube AI 語音字幕、自動配音,或上傳流程內建的聲音無障礙與草稿確認所選聲音的重複使用與匯出條款
CapCut TTS/CapCut 配音編輯器內的聲音直式草稿、20 秒測試確認所選聲音的重複使用與匯出條款
TextSpeechFree 可在 Studio 預覽;Basic 以上方案 提供 MP3 與商業用途試聽後匯出無桌面應用程式;付費每次產生 15,000 個字元

重點: 試試先做音訊:先放旁白,再讓畫面配合。發布前確認聲音與方案允許你的預定用途。

TextSpeech 提供以下流程:瀏覽器預覽 → 授權 MP3 匯出 → YouTube 旁白聲音 → 時間軸。本文是操作流程指南,不是聲音品質比較測試。

使用 AI 語音製作不露臉 YouTube

不露臉 YouTube 結合螢幕錄影、補充鏡頭或投影片與旁白。形式本身不決定合法性或營利資格;權利、原創價值與平台規範仍適用。

YouTube 的頻道營利政策評估原創性與真實性。重複或大量生產的內容可能不符資格;若各影片提供實質不同的內容,沿用形式不代表自動被排除。加入自己的示範、分析或解釋,而非只拼接借用的文字與片段。

每個系列維持一致聲音可能方便製作。記錄聲音、設定與授權;也可以有計畫地更換旁白。

你需要準備什麼

  • 完成的腳本,而非重點筆記。TTS 會照你輸入的內容朗讀。
  • TextSpeech Studio:超過 1,000 種聲音、11 種介面語言。
  • CapCut、Premiere 或 DaVinci Resolve。
  • 若影片會投放廣告或需要下載 MP3,請使用付費方案(Basic、Pro 或 Ultra)。Free 每次最多 500 個字元,僅供預覽,不含商業用途。請查看價格
  • 選配:付費方案的情緒標籤,可加強語氣而不必加速整段錄音。

投入 10 分鐘腳本之前,先在 Studio 試聽一個實際段落。如果仍像部落格文章,先改寫成適合口說的文字。

把腳本寫成口說語言

文字轉語音不會即興發揮。使用短句、把數字寫成讀法,省略「歡迎回到本頻道」之類的暖場空話。

影片長度每分鐘 140 個英文單字(教學)每分鐘 160 個英文單字(解說)能放進一次 Free 產生的 500 個字元嗎?
60 秒140160不行:使用付費區塊或拆分
8 分鐘1,1201,280不行:使用付費方案;超過字元上限才需拆分
10 分鐘1,4001,600不行:使用付費方案;超過字元上限才需拆分

會改變音訊結果的規則:

  • 每句一個想法。句號能形成 TTS 會遵循的停頓,連串逗號通常做不到。
  • 寫出你想聽到的讀法:10%ten percent;必要時以音標式拼法處理產品名稱。
  • 儘早說明目的或核心問題。發布後查看自己的觀眾留存資料;本文並未建立通用的 12 秒分界。
  • 先產生音訊,再剪補充鏡頭。硬把旁白塞進已定稿的畫面會產生空白。

直接切入主題的開場範例(CapCut 教學)

大多數 CapCut 字幕失敗只有一個原因。你替吵雜房間的錄音自動加字幕,接著花二十分鐘修正名稱。先產生旁白,再為乾淨的檔案加字幕。

英文原文共有 27 個單字(每分鐘 140 個英文單字時約 12 秒)。在 Free 只產生這一段來測試節奏。如果用手機喇叭以 1.0x 播放仍無法吸引人,就先不要產生其餘腳本。

在 Studio 產生 AI 配音

Studio 實際截圖,介面為英文:範例為 171/500 個字元、速度 1.00x,尚未選擇聲音或產生音訊。這是準備步驟,不是音質測試。

Studio 實際截圖,介面為英文:範例為 171/500 個字元、速度 1.00x,尚未選擇聲音或產生音訊。這是準備步驟,不是音質測試。

  1. 開啟 Studio,或從 YouTube 語音產生器頁面開始,篩選旁白風格的聲音。
  2. 貼上一個符合方案上限的段落。Basic/Pro 每次可產生 15,000 個字元,8 分鐘英文腳本通常放得下;實際字元數超過上限才需拆分,也可為方便剪輯自行分段。
  3. 以相同段落和速度比較兩種聲音,依發音與清晰度選擇。下列建議是試聽起點,不是各類頻道必須遵守的規則。
  4. 預覽 20–30 秒。先微調速度(長教學適合 0.95–1.0x),再花點數產生整段。
  5. 付費方案匯出 MP3。只有要在 DAW 混音時才使用 WAV。

若某個字發音出錯,修改文字,不要重做整段。調整拼音並縮短句子,比重新產生 1,000 個英文單字更有效。

可試聽的聲音與速度建議

頻道聲音方向速度
軟體/操作教學溫暖、清晰、中音0.95–1.0x
財經/新聞較低沉、穩定1.0x
紀錄片/清單型內容中性旁白;只在開場加強活力1.0x
Shorts 風格 YouTube較明亮、句子較短1.05–1.15x

付費方案包含情緒標籤,可以逐句加強語氣;當一句話需要活力、又不想加速整段時很實用。

匯出 MP3 並遵守產生上限

TextSpeech 方案限制(2026 年 9 月):

方案每次產生字元數MP3 下載商業用途
Free500僅預覽
Basic / Pro15,000
Ultra30,000

10 分鐘 YouTube 腳本(約 1,400 個英文單字)通常可放進一次 15,000 個字元的產生。請檢查實際字元數,超過上限才需拆分,也可為剪輯方便自行分段。依段落命名檔案: 01-hook.mp302-demo.mp303-close.mp3,再於時間軸串接。

更多匯出資訊:文字轉 MP3

CapCut 配音:匯入並先剪音訊

CapCut 內建 TTS 可能符合你的流程。若需要可重複使用的獨立檔案,可匯入 MP3。選定系列聲音前,請確認你所用版本的聲音供應、匯出選項與使用條款。

  1. 新增專案匯入 Studio MP3。記下長度,這就是你的時間基準。
  2. 接著匯入螢幕錄影或補充鏡頭。依音訊剪畫面
  3. 在段落交界拆分音訊(腳本中的每個 H2),修正一段時才不必重建整條時間軸。
  4. 依腳本製作字幕,或對照腳本修正自動字幕。檢查產品名稱,並將每條字幕時間對齊最終音訊。
  5. 說話時降低音樂,聆聽語音是否清楚並檢查削波。降低 12–18 dB 可作為起點;適當音量取決於錄音。
  6. 匯出 1080p(來源為 4K 則可匯出 4K)。音訊使用 AAC、48 kHz。

Premiere 與 DaVinci 的順序相同:音訊底稿 → 畫面 → 字幕。

若已使用 CapCut TTS,且符合需求與授權,可繼續保留。比較匯入 MP3 時,先將原音軌靜音、把新音軌對齊起點,確認時間後再決定是否移除原檔。

在 YouTube 透過 AI 配音營利

上傳時請查看 YouTube 的 AI 揭露要求。目前 YouTube Studio 官方步驟為屬性 → AI 使用:符合逼真且有實質 AI 生成或變更的標準時選「是」,否則選「否」。並非所有 TTS 用途都自動需要揭露。揭露本身不會取消營利資格;頻道與內容仍須符合營利政策。

開啟廣告前的檢查清單:

  • 腳本和畫面都是你自己的,不是改寫文章或擷取別人的清單。
  • TTS 授權包含商業/YouTube 用途(TextSpeech 的 Basic 以上方案;Free 不包含)。
  • 你從 Studio 匯出了真正的 MP3,而不是錄製預覽播放器畫面。
  • 字幕由腳本製作並上傳。
  • 音樂具有授權,且音量低於人聲。
  • 在上傳流程要求的地方誠實填寫 AI 揭露資訊。

分別確認腳本、畫面、音樂與所選聲音的權利。訂閱 TTS 不代表取得他人素材的權利;版權授權與 YouTube 的重複使用內容審查是不同事項。

常見錯誤

  • 未確認是否適合整段教學,就選用充滿活力的廣告聲線。
  • 貼上前未檢查實際字元數是否超過 500 個字元(Free)或 15,000 個字元(Basic/Pro)的上限。
  • 先剪影片,再強迫 TTS 配合任意切點。
  • 沒有記錄聲音與設定,導致日後使用任何工具都較難重現後續集數。
  • 用同一模板製作 30 支幾乎相同的「前 10 名」影片,這就是 YouTube 管制的量產模式。
  • 只用錄音室耳機聽。手機喇叭、1.0x 播放才是誠實的測試。

常見問題

YouTube 會取消 AI 聲音的營利嗎?

TTS 本身不決定營利資格。YouTube 會依營利政策審查頻道及內容,包括原創性與重複使用規範。取得授權不代表保證能營利。

不露臉 YouTube 頻道可以使用 AI 配音嗎?

可以,前提是影片提供原創價值:你的螢幕錄影、你的測試、你的剪輯,而不是投影片加上擷取來的文字。

如何在 CapCut 加入 AI 配音?

Studio 產生 MP3,匯入 CapCut,依音訊剪補充鏡頭,再根據腳本加字幕。CapCut TTS 可選擇用於草稿。Premiere 也使用相同順序。

YouTube 應使用 MP3 還是 WAV?

CapCut 和 YouTube 上傳使用 MP3。若先在 DAW 等化或壓縮,則使用 WAV。

我需要複製自己的聲音嗎?

不需要。你可以選擇有授權的聲音庫旁白。請確認條款,並避免未經適當同意冒用他人身分。

YouTube AI 配音要花多少錢?

每日簽到點數範圍內可免費預覽。MP3 與商業用途從 Basic 開始提供。 10 分鐘影片約 1,400 個英文單字,通常可放進一次 15,000 個字元的產生。請檢查實際字元數;超過上限才需拆分,其餘情況可為方便剪輯自行分段。

先在 Studio 產生前 30 秒。等這段聽起來像你願意追蹤的主持人,再完成其餘腳本。

繼續閱讀

在 Studio 試一句

選音色、貼稿,匯出前先聽這一條。