• AIナレーション
  • AI音声解説

CapCutでYouTube動画にAIナレーションを追加する方法

YouTubeのAIナレーション:台本を試聴し、利用権を確認してMP3を書き出し、CapCutで音声から編集。内蔵TTSと読み込みファイルを用途に合わせて比較します。

TextSpeechチーム11分で読める
デスクライト、ヘッドホン、音声タイムラインを表示するモニターが置かれた机

短い答え: AIナレーション(AIボイスオーバー)は台本を音声にします。聞きやすく書き、一部を試聴し、商用利用権を確認してMP3を書き出し、CapCutで音声から編集します。内蔵TTSもシリーズに使える場合があります。声の提供状況、書き出し、現行の条件を比較してください。

AIナレーションとAIボイスオーバーは同じ作業です。再利用と編集の自由度に合わせて、内蔵音声か独立ファイルかを選びます。

最終更新:2026年9月14日。 資料確認:YouTubeの公式開示・収益化文書を2026年9月14日に確認しました。声や編集手順は提案であり、試聴試験、視聴維持実験、ログイン状態のアップロード試験の結果ではありません。

AIナレーション、YouTube TTS、CapCut TTSの比較

音声の供給元内容得意な用途苦手な用途
AIナレーション/AIボイスオーバー(ブラウザースタジオ)台本 → プレビュー → MP3固定のシリーズ音声、商用ライセンス、翌週も同じ声声の再利用と書き出し条件を確認
YouTube TTS/YouTube AI音声字幕、自動吹き替え、アップロード手順に組み込まれた音声アクセシビリティと下書き声の再利用と書き出し条件を確認
CapCut TTS/CapCutナレーションエディター内の音声縦型の下書き、20秒のテスト声の再利用と書き出し条件を確認
TextSpeechFreeはStudioのプレビュー、Basic以上はMP3と商用利用試聴してから書き出すデスクトップアプリなし、有料生成は1回15,000文字

要点: 音声を先に置いて映像を合わせる編集を試しましょう。公開前に声とプランが予定する用途を許可しているか確認します。

TextSpeechの流れは、ブラウザープレビュー → ライセンス付きMP3 → YouTube向けナレーター音声 → タイムラインです。これは作業ガイドであり、音声品質の比較試験ではありません。

AI音声を使った顔出しなしYouTube

顔出しなしYouTubeは画面録画、補足映像、スライドと語りを組み合わせます。形式だけで合法性や収益化は決まりません。権利、独自の価値、プラットフォームの規則は引き続き適用されます。

YouTubeのチャンネル収益化ポリシーは独創性と真正性を審査します。反復的・大量生産のコンテンツは対象外になり得ますが、各動画の中身が実質的に異なれば、同じ形式だけで除外されるわけではありません。借りた文章やクリップの寄せ集めではなく、自分の実演、分析、解説を加えましょう。

シリーズで同じ声を使うと制作しやすい場合があります。声、設定、ライセンスを記録してください。計画的な語り手の変更も可能です。

必要なもの

  • 箇条書きのメモではなく、完成した台本。TTSは入力したとおりに読みます。
  • TextSpeech Studio:1,000以上の音声、11のUI言語。
  • CapCut、Premiere、DaVinci Resolveのいずれか。
  • 動画に広告を付ける場合やMP3をダウンロードする場合は有料プラン(Basic、Pro、Ultra)。Freeは1回500文字まで、プレビューのみで商用利用不可。料金をご覧ください。
  • 任意:有料プランの感情タグ。全体を速めずに強調できます。

10分の台本に取りかかる前に、Studioで実際の1段落を試聴してください。まだブログ記事のようなら、先に話し言葉に書き直します。

話すための台本を書く

テキスト読み上げは即興で補いません。短い文、読み方を文字にした数字を使い、「チャンネルへようこそ」のような前置きは省きます。

動画の長さ毎分140英単語(チュートリアル)毎分160英単語(解説)Freeの1回500文字に収まる?
60秒140160いいえ。有料の区切りを使うか分割
8分1,1201,280いいえ。有料プランを使い、文字数上限を超える場合のみ分割
10分1,4001,600いいえ。有料プランを使い、文字数上限を超える場合のみ分割

音声ファイルを変えるルール:

  • 1文に一つの考え。句点はTTSが認識する間を作りますが、読点の連続ではそうならない場合が多いです。
  • 読ませたい表記にする:10%ten percent。製品名も必要なら発音に合わせて書きます。
  • 目的や中心の問いを早めに示します。公開後に自分の視聴者維持データを確認してください。ここでは普遍的な12秒の境界を示していません。
  • 音声を先に生成し、補足映像を切ります。完成済み映像にナレーションを合わせると無音の空白が生まれます。

いきなり本題に入る冒頭例(CapCutチュートリアル)

CapCutの字幕がうまくいかない理由は、たいてい一つです。騒がしい部屋の音声に自動字幕を付け、その後で名前の修正に二十分かけているからです。先にナレーションを生成しましょう。それからきれいな音声に字幕を付けます。

英語原文は27単語(毎分140英単語で約12秒)です。Freeでこの部分だけ生成し、テンポを試します。スマートフォンのスピーカーで1.0x再生して引き付けられなければ、残りはまだ生成しないでください。

StudioでAIナレーションを生成する

Studioの実際の英語画面。例文は171/500文字、速度1.00xで、声の選択・生成前です。準備を示すもので、音質試験ではありません。

Studioの実際の英語画面。例文は171/500文字、速度1.00xで、声の選択・生成前です。準備を示すもので、音質試験ではありません。

  1. Studioを開くか、YouTube音声生成ページからナレーター向け音声を絞り込みます。
  2. 上限内の一つのセクションを貼ります。Basic/Proは1回15,000文字です。8分の英語台本は通常収まります。実際の文字数が上限を超える場合に分割し、編集しやすくするための任意の分割も可能です。
  3. 同じ段落と速度で二つの声を比較し、発音と明瞭さで選びます。以下は試聴の出発点であり、チャンネル別の決まりではありません。
  4. 20–30秒を試聴します。全セクションにクレジットを使う前に、速度を少し調整します(長いチュートリアルは0.95–1.0x)。
  5. 有料プランでMP3を書き出します。WAVはDAWでミックスする場合のみ。

単語が崩れたら、セクション全体ではなくテキストを直します。発音表記と短い文のほうが、1,000英単語を再生成するより効果的です。

試聴する声と速度のアイデア

チャンネル音声方針速度
ソフトウェア/使い方温かく明瞭な中音0.95–1.0x
金融/ニュース低めで落ち着いた声1.0x
ドキュメンタリー/リスト記事中立的な語り手。冒頭のみ活気を付ける1.0x
Shorts風YouTube明るめ、短い文1.05–1.15x

有料プランの感情タグは行単位で強調できます。段落全体を速めず、一文に活気を付けたい場合に便利です。

MP3を書き出し、生成上限を守る

TextSpeechのプラン上限(2026年9月):

プラン1回の生成文字数MP3ダウンロード商用利用
Free500プレビューのみ不可
Basic / Pro15,000
Ultra30,000

10分のYouTube台本(約1,400英単語)は通常、15,000文字の生成1回に収まります。実際の文字数を確認し、上限を超えたら分割します。編集のための任意の分割も可能です。セクション別のファイル名: 01-hook.mp302-demo.mp303-close.mp3とし、タイムラインで連結します。

書き出しの詳細:テキストからMP3

CapCutナレーション:音声を読み込んで先に編集

CapCut内蔵TTSが用途に合うこともあります。再利用できる独立ファイルが必要ならMP3を読み込みます。シリーズに採用する前に、使用中のバージョンで声の提供状況、書き出し、利用条件を確認してください。

  1. 新規プロジェクト → StudioのMP3を最初に読み込みます。長さを確認し、それを時間の基準にします。
  2. 次に画面録画や補足映像を読み込みます。音声に合わせて映像を切ります
  3. セクションの区切りで音声を分割します(台本の各H2)。一段落の修正でタイムライン全体を作り直さずに済みます。
  4. 台本から字幕を作るか、自動字幕を台本と照合して修正します。製品名を確認し、各字幕を最終音声のタイミングに合わせます。
  5. 発話中は音楽を下げ、聞き取りやすさとクリッピングを確認します。12–18 dBの低減は出発点にできますが、適切なレベルは録音によります。
  6. 1080p(素材が4Kなら4K)で書き出します。AAC音声、48 kHz。

PremiereとDaVinciも同じ順序です。音声の土台 → 映像 → 字幕。

すでにCapCut TTSを使っており、要件とライセンスに合うなら残せます。MP3を比較するには元のトラックをミュートし、置換音声を冒頭に合わせ、削除前にタイミングを確認します。

YouTubeでAIナレーションを収益化する

アップロード時にYouTubeのAI開示要件を確認します。現在の公式手順はYouTube Studioの属性 → AI使用で、リアルで実質的なAI生成・改変の基準に該当すれば「はい」、それ以外は「いいえ」です。TTSのすべての用途で自動的に開示が必要なわけではありません。開示自体で収益化資格を失うことはなく、チャンネルと内容は収益化規則を満たす必要があります。

広告を付ける前のチェック項目:

  • 台本と映像が自分のもので、記事の書き換えや収集したリストではない。
  • TTSライセンスに商用/YouTube利用が含まれる(TextSpeechはBasic以上、Freeは含まない)。
  • プレビュープレーヤーの画面録画ではなく、Studioから本物のMP3を書き出した。
  • 台本から作った字幕をアップロードした。
  • 音楽にライセンスがあり、声より音量を下げた。
  • アップロード手順で求められるAI開示を正直に記入した。

台本、映像、音楽、選んだ声の権利を別々に確認してください。TTS契約は他人の素材の権利を与えません。著作権の許諾とYouTubeの再利用コンテンツ審査も別です。

よくある失敗

  • チュートリアル全体に合うか確認せず、元気な広告風の声を選ぶ。
  • 実際の文字数が500文字(Free)または15,000文字(Basic/Pro)の上限を超えないか確認せずに貼り付ける。
  • 動画を先に編集し、任意のカットにTTSを無理に合わせる。
  • 声と設定を記録せず、どのツールでも後のエピソードを再現しにくくする。
  • 同じテンプレートでほぼ同一の「トップ10」動画を30本作る。これはYouTubeが取り締まる量産パターンです。
  • スタジオヘッドホンだけで聞く。スマートフォンのスピーカーで1.0xが正直なテストです。

よくある質問

YouTubeはAI音声の収益化を停止しますか?

TTSだけで資格は決まりません。YouTubeは独創性や再利用を含む収益化ポリシーでチャンネルと内容を審査します。ライセンスは収益化の保証ではありません。

顔出しなしYouTubeチャンネルでAIナレーションを使えますか?

使えます。自分の画面録画、検証、編集という独自の価値が必要です。スライドショーとかき集めた文章だけではありません。

CapCutでAIナレーションを追加するには?

StudioでMP3を生成してCapCutに読み込み、音声に合わせて補足映像を切り、台本から字幕を作ります。下書きでCapCut TTSを使うかは任意です。Premiereも同じ順序です。

YouTubeにはMP3とWAVのどちらがよいですか?

CapCutとYouTubeへのアップロードにはMP3。先にDAWでEQやコンプレッサーを使うならWAVです。

自分の声をクローンする必要はありますか?

不要です。ライセンスのあるライブラリー音声を選べます。条件を確認し、適切な許可なく他人になりすますことは避けてください。

YouTube用AIナレーションの料金は?

毎日のチェックインポイントの範囲でプレビューは無料です。MP3と商用利用はBasicから。 10分動画は約1,400英単語で、通常15,000文字の生成1回に収まります。実際の文字数を確認してください。分割が必要なのは上限を超える場合で、それ以外は編集のための任意の選択です。

Studioで最初の30秒を生成してください。その段落が、あなた自身もフォローしたくなる語り手に聞こえてから、残りの台本を仕上げましょう。

関連ガイド

Studioで一文試す

声を選び、台本を貼って、書き出す前にテイクを確認できます。