簡短回答: AI 有聲書是從手稿產生的章節音訊。ElevenLabs Audiobooks 等上傳型工具可接收 EPUB 並辨識章節。TextSpeech 則是貼上文字式的有聲書製作工具:從 Word 或 Google 文件複製文字,每次貼上一章或更少的內容,遵守每次產生的字元上限,再透過付費方案匯出 MP3。這適合獨立課程、連載小說和 Podcast 風格書籍,而非「上傳一部 9 萬個英文單字的小說,五分鐘就得到一個檔案」。
這項工作分成兩種。AI 有聲書產生器或製作工具,一種讓你上傳 EPUB/電子書檔案,另一種讓你逐章以文字製作有聲書。購買前應先弄清楚是哪一種。
2026 年 9 月 14 日依官方文件查核。本指南整理文件中的流程,並非親自試聽的評測。你必須擁有文字的音訊使用權。
AI 有聲書工具與 EPUB 轉換器比較
| 平台/指南 | 輸入方式 | 章節處理 | TextSpeech 的差異 |
|---|---|---|---|
| ElevenLabs Audiobooks | 上傳 EPUB | 自動辨識章節;多角色配音 | 不上傳檔案,從編輯器貼上文字 |
| AudiobookGen | 上傳 EPUB | 整本書轉換流程 | 手動分章;自行控制貼上份量 |
| Audie.ai | 上傳手稿 | 著重多聲線小說 | 單一旁白流程 |
| TextSpeech | 在瀏覽器貼上 | 由你依章節或場景切分 | 免費預覽每次 500 字元;付費可匯出 MP3 並商用 |
TextSpeech 坦白說:我們是適合貼上章節份量文字的瀏覽器工作室,不是 EPUB 轉有聲書工具。如果你需要上傳後自動處理,ElevenLabs 或 AudiobookGen 更適合將 EPUB 或電子書轉為有聲書。如果你想要超過 1,000 種聲音、情緒標籤,以及製作 AI 配音時使用的同一套工具,就留在 Studio,但要準備多次匯出。
必須預先考量的 TextSpeech 限制
| 方案 | 每次產生字元數 | 約當英文字數 | MP3 匯出 | 商業使用 |
|---|---|---|---|---|
| Free | 500 | 70–90 | 僅預覽 | 否 |
| Basic / Pro | 15,000 | 約 2,200–2,500 | 是 | 是 |
| Ultra | 30,000 | 約 4,500–5,000 | 是 | 是 |
**一次產生不等於一本書。**依章節或場景切分手稿,計算每個區塊的字元數,並預留重新產生與完整試聽的時間。MP3 數量取決於實際章節長度,而不只是總字數。
免費方案適合用第一章開頭試聽旁白,不能用來交付可販售的檔案。
貼上前需要準備什麼
- 手稿的音訊使用權,例如自己的作品、取得授權的素材,或已確認屬於公共領域的內容。
- 在 Studio 比較同一整頁,包含對話與難讀人名。YouTube 風格旁白可列入試聽選項;依自己的手稿評估發音、節奏與一致性。
- 命名規則:
01-chapter-one.mp3、02-chapter-two.mp3。 - 使用 Basic、Pro 或 Ultra 匯出 MP3 並進行商業發行。請見條款。
整理手稿
印刷排版可能讓 TTS 出錯。貼上前先做以下處理:
- 移除標題或改寫成適合朗讀的形式:若數字讀錯,將
Chapter 3改為Chapter three。 - 將表格轉為口述清單,或刪除。
- 展開聲音可能念錯的縮寫,例如
K8s、檔案路徑和網址。 - **對話:**單一旁白書籍每段只安排一位說話者。
- 移除註腳標記和頁碼參照,否則 TTS 會把
p. 247念出來。
以文字製作有聲書:章節流程
以下是使用 TextSpeech 將文字轉成有聲書、逐章製作的方式。
- 開啟 Studio,整個專案固定使用同一個聲音 ID,並在筆記檔記下名稱。
- 只貼上第一章,或先貼上不超過 15,000 字元的第一個區塊。
- 產生音訊。檢查開頭、中段與結尾,匯出前再完整聽過整章。
- 在文字中修正發音問題,必要時重新產生該段。
- 使用付費方案透過文字轉 MP3 匯出 MP3。
- 製作第二章,不要更換聲音。
先從 1.0x 開始,再用稍微不同的速度比較同一段。選擇能清楚呈現人名、對話與停頓的設定;速度數值本身不能證明品質。
示意計算:整理後的章節
若整理後的章節包含 12,500 個字元,就在 Basic/Pro 每次 15,000 字元的上限內,可產生一次。這是示意計算,並非提供或測試過的樣本。產生前請計算實際章節字元數。
- 將
3.4 Implementation details改寫為Section three point four. Implementation details.。 - 將三欄表格改成三句口述文字。
- 產生後跳到章節中段。如果平實文字仍被讀得「笑意滿滿」,請在第二章之前從聲音庫換成更沉穩的聲音,不要之後才換。
- 匯出 MP3。假設每分鐘 150 個英文單字,2,100 個英文單字約 14 分鐘。檢查實際音訊有無漏字與停頓長度,不能只憑時長判斷品質。
- 第二章:相同聲音 ID、相同語速、相同匯出設定。
從 EPUB 擷取章節文字,再製作有聲書
TextSpeech 不能上傳 EPUB 或 DOCX。若你有改作授權且 EPUB 不含 DRM,可採用以下手動流程。若複製受限,請取得合法授權的無 DRM 版本或原始手稿;此流程不移除 DRM。導覽與複製操作見 calibre 閱讀器手冊。
- 將已授權的 EPUB 加入 calibre,選取書籍並按「檢視」開啟電子書閱讀器。
- 開啟目錄並選取章節。若沒有可用目錄,找到章節標題並確認下一章開始的位置。
- 選取章節文字,按右鍵選「複製」。長章節可分成連續小段複製,核對每段首尾句以免遺漏或重複。
- 先貼到純文字編輯器,移除導覽文字、註釋與重複標題,改寫表格並核對章節內容。計算字元數,在段落邊界切分至方案上限以內。
- 將整理好的區塊貼到 Studio,維持相同聲音設定,試聽修正後以付費方案匯出 MP3。依序重複,並以章節及分段命名檔案。
以下情況適合上傳型轉換器:
- 書籍已有整潔的 EPUB,並具備真正的章節標記。
- 你需要自動辨識章節、走完一套流程,而非貼上 25 次。
- 你能接受該供應商的旁白選擇和商業條款。
以下情況適合留在 Studio:
- 手稿仍在 Google 文件或 Word。
- 你已在聲音庫選好主持聲音,並希望 YouTube 片段也使用相同聲線。
- 你寧可今晚檢查一章的品質,也不想除錯 EPUB 目錄。
聆聽、品管與組合
發行前請進行以下聆聽檢查:
- 在批次處理其餘內容前,先把每一章完整聽過一次。
- 各檔案的響度應一致,不要把第一章峰值正規化到 −0.1 dB,卻讓第二章維持 −12 dB。
- 保留品管紀錄:時間戳記、問題、修正方式,例如改寫句子、加逗號停頓、以發音方式拼寫人名。
TextSpeech 匯出 MP3。確認發行目的地的編碼、響度、靜音、片頭片尾與檔案排序要求,需要時使用音訊編輯器調整。技術上的母帶處理不代表取得 AI 旁白發行許可。
出版與發行
| 通路 | AI 旁白政策 | 應採取的行動 |
|---|---|---|
| 自己的網站/課程/Podcast | 取決於你的權利與平台規則 | 發布前確認授權與平台內容規範 |
| Google Play Books | 上傳指南提供 AI 有聲書的 Synthesized voice 設定 | 正確設定旁白類型並符合帳戶、內容與檔案要求;這與 Google 自動旁白工具不同 |
| Kobo Writing Life | 接受 AI 旁白,但須標示合成聲音旁白中繼資料 | 填寫作者與旁白貢獻者,並遵守目前的上傳要求 |
| ACX/經 ACX 發行至 Audible | 除非另獲授權,必須真人旁白;禁止未授權的 TTS/AI | 未取得授權前不要提交 TextSpeech 匯出檔;只有母帶處理不能取得資格 |
平台要求時應揭露 AI 旁白。發行規則會變動,承諾上市日期前,先到零售商的作者入口網站查證。
常見錯誤
- 工具每次上限為 15,000 字元,卻期待一次貼完整本書。
- 將免費方案預覽音訊放進付費商品,沒有 MP3 匯出,也沒有商用授權。
- 因為第一章「需要更多活力」,到第四章才更換旁白。
- 未確認語音清晰度、音樂使用權及發行平台規則便加入配樂。保留背景音樂前,先與純語音版本比較。
- 使用名人/角色聲音作為正式有聲書主持,請參閱條款與冒充他人的相關規則。
常見問題
需要上傳 PDF 或 EPUB 嗎?
不需要。TextSpeech 不提供手稿上傳。從 Word、Google 文件或 Scrivener 複製,再貼到 Studio。ElevenLabs Audiobooks 和 AudiobookGen 等競爭工具以檔案上傳為核心,那才是 EPUB 轉有聲書的工作。
免費方案能製作完整有聲書嗎?
你可以預覽短區塊,每次產生 500 字元。交付章節 MP3 需要付費方案。
我的書會產生多少個檔案?
計算每個整理後章節的實際字元數,各自除以方案每次產生的字元上限,向上取整後再相加。這是最低估計;保留段落或場景邊界可能需要更多檔案,重新產生也可能增加版本。
這與電子書轉有聲書工具有什麼不同?
轉換器會自動匯入 EPUB 並辨識章節。TextSpeech 提供聲音選擇、情緒標籤,以及製作 YouTube 內容時使用的同一個 Studio,代價是需要手動貼上章節。
也可以把章節發布到 YouTube 嗎?
可以,原創腳本與剪輯仍然重要。請參閱如何為 YouTube 加上 AI 配音。
MP3 還是 WAV?
TextSpeech 文件列出的匯出格式是 MP3。保留原檔供編輯使用;將有損 MP3 轉成 WAV 不會恢復流失的細節。依發行目的地要求選擇交付格式,並另行確認 AI 旁白資格。
在 Studio 產生第一章,用手機聽到第五分鐘。如果你不願在通勤時聽這位主持,就在第二章之前更換聲音。


