短い答え: AIナレーション(AIボイスオーバー)は台本を音声にします。聞きやすく書き、一部を試聴し、商用利用権を確認してMP3を書き出し、CapCutで音声から編集します。内蔵TTSもシリーズに使える場合があります。声の提供状況、書き出し、現行の条件を比較してください。
AIナレーションとAIボイスオーバーは同じ作業です。再利用と編集の自由度に合わせて、内蔵音声か独立ファイルかを選びます。
最終更新:2026年9月14日。 資料確認:YouTubeの公式開示・収益化文書を2026年9月14日に確認しました。声や編集手順は提案であり、試聴試験、視聴維持実験、ログイン状態のアップロード試験の結果ではありません。
AIナレーション、YouTube TTS、CapCut TTSの比較
| 音声の供給元 | 内容 | 得意な用途 | 苦手な用途 |
|---|---|---|---|
| AIナレーション/AIボイスオーバー(ブラウザースタジオ) | 台本 → プレビュー → MP3 | 固定のシリーズ音声、商用ライセンス、翌週も同じ声 | 声の再利用と書き出し条件を確認 |
| YouTube TTS/YouTube AI音声 | 字幕、自動吹き替え、アップロード手順に組み込まれた音声 | アクセシビリティと下書き | 声の再利用と書き出し条件を確認 |
| CapCut TTS/CapCutナレーション | エディター内の音声 | 縦型の下書き、20秒のテスト | 声の再利用と書き出し条件を確認 |
| TextSpeech | FreeはStudioのプレビュー、Basic以上はMP3と商用利用 | 試聴してから書き出す | デスクトップアプリなし、有料生成は1回15,000文字 |
要点: 音声を先に置いて映像を合わせる編集を試しましょう。公開前に声とプランが予定する用途を許可しているか確認します。
TextSpeechの流れは、ブラウザープレビュー → ライセンス付きMP3 → YouTube向けナレーター音声 → タイムラインです。これは作業ガイドであり、音声品質の比較試験ではありません。
AI音声を使った顔出しなしYouTube
顔出しなしYouTubeは画面録画、補足映像、スライドと語りを組み合わせます。形式だけで合法性や収益化は決まりません。権利、独自の価値、プラットフォームの規則は引き続き適用されます。
YouTubeのチャンネル収益化ポリシーは独創性と真正性を審査します。反復的・大量生産のコンテンツは対象外になり得ますが、各動画の中身が実質的に異なれば、同じ形式だけで除外されるわけではありません。借りた文章やクリップの寄せ集めではなく、自分の実演、分析、解説を加えましょう。
シリーズで同じ声を使うと制作しやすい場合があります。声、設定、ライセンスを記録してください。計画的な語り手の変更も可能です。
必要なもの
- 箇条書きのメモではなく、完成した台本。TTSは入力したとおりに読みます。
- TextSpeech Studio:1,000以上の音声、11のUI言語。
- CapCut、Premiere、DaVinci Resolveのいずれか。
- 動画に広告を付ける場合やMP3をダウンロードする場合は有料プラン(Basic、Pro、Ultra)。Freeは1回500文字まで、プレビューのみで商用利用不可。料金をご覧ください。
- 任意:有料プランの感情タグ。全体を速めずに強調できます。
10分の台本に取りかかる前に、Studioで実際の1段落を試聴してください。まだブログ記事のようなら、先に話し言葉に書き直します。
話すための台本を書く
テキスト読み上げは即興で補いません。短い文、読み方を文字にした数字を使い、「チャンネルへようこそ」のような前置きは省きます。
| 動画の長さ | 毎分140英単語(チュートリアル) | 毎分160英単語(解説) | Freeの1回500文字に収まる? |
|---|---|---|---|
| 60秒 | 140 | 160 | いいえ。有料の区切りを使うか分割 |
| 8分 | 1,120 | 1,280 | いいえ。有料プランを使い、文字数上限を超える場合のみ分割 |
| 10分 | 1,400 | 1,600 | いいえ。有料プランを使い、文字数上限を超える場合のみ分割 |
音声ファイルを変えるルール:
- 1文に一つの考え。句点はTTSが認識する間を作りますが、読点の連続ではそうならない場合が多いです。
- 読ませたい表記にする:
10%→ten percent。製品名も必要なら発音に合わせて書きます。 - 目的や中心の問いを早めに示します。公開後に自分の視聴者維持データを確認してください。ここでは普遍的な12秒の境界を示していません。
- 音声を先に生成し、補足映像を切ります。完成済み映像にナレーションを合わせると無音の空白が生まれます。
いきなり本題に入る冒頭例(CapCutチュートリアル)
CapCutの字幕がうまくいかない理由は、たいてい一つです。騒がしい部屋の音声に自動字幕を付け、その後で名前の修正に二十分かけているからです。先にナレーションを生成しましょう。それからきれいな音声に字幕を付けます。
英語原文は27単語(毎分140英単語で約12秒)です。Freeでこの部分だけ生成し、テンポを試します。スマートフォンのスピーカーで1.0x再生して引き付けられなければ、残りはまだ生成しないでください。
StudioでAIナレーションを生成する
Studioの実際の英語画面。例文は171/500文字、速度1.00xで、声の選択・生成前です。準備を示すもので、音質試験ではありません。
- Studioを開くか、YouTube音声生成ページからナレーター向け音声を絞り込みます。
- 上限内の一つのセクションを貼ります。Basic/Proは1回15,000文字です。8分の英語台本は通常収まります。実際の文字数が上限を超える場合に分割し、編集しやすくするための任意の分割も可能です。
- 同じ段落と速度で二つの声を比較し、発音と明瞭さで選びます。以下は試聴の出発点であり、チャンネル別の決まりではありません。
- 20–30秒を試聴します。全セクションにクレジットを使う前に、速度を少し調整します(長いチュートリアルは0.95–1.0x)。
- 有料プランでMP3を書き出します。WAVはDAWでミックスする場合のみ。
単語が崩れたら、セクション全体ではなくテキストを直します。発音表記と短い文のほうが、1,000英単語を再生成するより効果的です。
試聴する声と速度のアイデア
| チャンネル | 音声方針 | 速度 |
|---|---|---|
| ソフトウェア/使い方 | 温かく明瞭な中音 | 0.95–1.0x |
| 金融/ニュース | 低めで落ち着いた声 | 1.0x |
| ドキュメンタリー/リスト記事 | 中立的な語り手。冒頭のみ活気を付ける | 1.0x |
| Shorts風YouTube | 明るめ、短い文 | 1.05–1.15x |
有料プランの感情タグは行単位で強調できます。段落全体を速めず、一文に活気を付けたい場合に便利です。
MP3を書き出し、生成上限を守る
TextSpeechのプラン上限(2026年9月):
| プラン | 1回の生成文字数 | MP3ダウンロード | 商用利用 |
|---|---|---|---|
| Free | 500 | プレビューのみ | 不可 |
| Basic / Pro | 15,000 | 可 | 可 |
| Ultra | 30,000 | 可 | 可 |
10分のYouTube台本(約1,400英単語)は通常、15,000文字の生成1回に収まります。実際の文字数を確認し、上限を超えたら分割します。編集のための任意の分割も可能です。セクション別のファイル名: 01-hook.mp3、02-demo.mp3、03-close.mp3とし、タイムラインで連結します。
書き出しの詳細:テキストからMP3。
CapCutナレーション:音声を読み込んで先に編集
CapCut内蔵TTSが用途に合うこともあります。再利用できる独立ファイルが必要ならMP3を読み込みます。シリーズに採用する前に、使用中のバージョンで声の提供状況、書き出し、利用条件を確認してください。
- 新規プロジェクト → StudioのMP3を最初に読み込みます。長さを確認し、それを時間の基準にします。
- 次に画面録画や補足映像を読み込みます。音声に合わせて映像を切ります。
- セクションの区切りで音声を分割します(台本の各H2)。一段落の修正でタイムライン全体を作り直さずに済みます。
- 台本から字幕を作るか、自動字幕を台本と照合して修正します。製品名を確認し、各字幕を最終音声のタイミングに合わせます。
- 発話中は音楽を下げ、聞き取りやすさとクリッピングを確認します。12–18 dBの低減は出発点にできますが、適切なレベルは録音によります。
- 1080p(素材が4Kなら4K)で書き出します。AAC音声、48 kHz。
PremiereとDaVinciも同じ順序です。音声の土台 → 映像 → 字幕。
すでにCapCut TTSを使っており、要件とライセンスに合うなら残せます。MP3を比較するには元のトラックをミュートし、置換音声を冒頭に合わせ、削除前にタイミングを確認します。
YouTubeでAIナレーションを収益化する
アップロード時にYouTubeのAI開示要件を確認します。現在の公式手順はYouTube Studioの属性 → AI使用で、リアルで実質的なAI生成・改変の基準に該当すれば「はい」、それ以外は「いいえ」です。TTSのすべての用途で自動的に開示が必要なわけではありません。開示自体で収益化資格を失うことはなく、チャンネルと内容は収益化規則を満たす必要があります。
広告を付ける前のチェック項目:
- 台本と映像が自分のもので、記事の書き換えや収集したリストではない。
- TTSライセンスに商用/YouTube利用が含まれる(TextSpeechはBasic以上、Freeは含まない)。
- プレビュープレーヤーの画面録画ではなく、Studioから本物のMP3を書き出した。
- 台本から作った字幕をアップロードした。
- 音楽にライセンスがあり、声より音量を下げた。
- アップロード手順で求められるAI開示を正直に記入した。
台本、映像、音楽、選んだ声の権利を別々に確認してください。TTS契約は他人の素材の権利を与えません。著作権の許諾とYouTubeの再利用コンテンツ審査も別です。
よくある失敗
- チュートリアル全体に合うか確認せず、元気な広告風の声を選ぶ。
- 実際の文字数が500文字(Free)または15,000文字(Basic/Pro)の上限を超えないか確認せずに貼り付ける。
- 動画を先に編集し、任意のカットにTTSを無理に合わせる。
- 声と設定を記録せず、どのツールでも後のエピソードを再現しにくくする。
- 同じテンプレートでほぼ同一の「トップ10」動画を30本作る。これはYouTubeが取り締まる量産パターンです。
- スタジオヘッドホンだけで聞く。スマートフォンのスピーカーで1.0xが正直なテストです。
よくある質問
YouTubeはAI音声の収益化を停止しますか?
TTSだけで資格は決まりません。YouTubeは独創性や再利用を含む収益化ポリシーでチャンネルと内容を審査します。ライセンスは収益化の保証ではありません。
顔出しなしYouTubeチャンネルでAIナレーションを使えますか?
使えます。自分の画面録画、検証、編集という独自の価値が必要です。スライドショーとかき集めた文章だけではありません。
CapCutでAIナレーションを追加するには?
StudioでMP3を生成してCapCutに読み込み、音声に合わせて補足映像を切り、台本から字幕を作ります。下書きでCapCut TTSを使うかは任意です。Premiereも同じ順序です。
YouTubeにはMP3とWAVのどちらがよいですか?
CapCutとYouTubeへのアップロードにはMP3。先にDAWでEQやコンプレッサーを使うならWAVです。
自分の声をクローンする必要はありますか?
不要です。ライセンスのあるライブラリー音声を選べます。条件を確認し、適切な許可なく他人になりすますことは避けてください。
YouTube用AIナレーションの料金は?
毎日のチェックインポイントの範囲でプレビューは無料です。MP3と商用利用はBasicから。 10分動画は約1,400英単語で、通常15,000文字の生成1回に収まります。実際の文字数を確認してください。分割が必要なのは上限を超える場合で、それ以外は編集のための任意の選択です。
Studioで最初の30秒を生成してください。その段落が、あなた自身もフォローしたくなる語り手に聞こえてから、残りの台本を仕上げましょう。


