Respuesta breve: La voz en off con IA (también locución con IA) convierte un guion en narración. Escribe para escuchar, prueba una sección, confirma los derechos comerciales, exporta MP3 y edita primero el audio en CapCut. El TTS integrado también puede servir para una serie; compara disponibilidad de voces, exportación y condiciones vigentes.
Voz en off y locución con IA significan lo mismo. Elige entre una voz del editor y un archivo separado según la reutilización y el control de edición que necesites.
Última actualización: 14 de septiembre de 2026. Revisión de fuentes: documentación oficial de YouTube sobre declaraciones y monetización consultada el 14 de septiembre de 2026. Las voces y los pasos de edición son sugerencias, no resultados de pruebas auditivas, experimentos de retención ni una prueba de subida con sesión iniciada.
Voz en off con IA frente a YouTube TTS y CapCut TTS
| Fuente | Qué es | Adecuado para | Poco adecuado para |
|---|---|---|---|
| Voz en off / locución con IA (estudio en el navegador) | Guion → vista previa → MP3 | Narrador fijo de una serie, licencia comercial, la misma voz la semana siguiente | Comprueba las condiciones de reutilización y exportación de la voz |
| YouTube TTS / voz de IA de YouTube | Subtítulos, doblaje automático o una voz integrada en el proceso de subida | Accesibilidad y borradores | Comprueba las condiciones de reutilización y exportación de la voz |
| CapCut TTS / voz en off de CapCut | Voces dentro del editor | Borrador vertical, prueba de 20 segundos | Comprueba las condiciones de reutilización y exportación de la voz |
| TextSpeech | Vista previa de Studio en Free; MP3 + uso comercial en Basic y superiores | Probar voces y después exportar | Sin aplicación de escritorio; 15.000 caracteres por generación de pago |
Conclusión: Prueba el montaje empezando por el audio: coloca la narración y adapta la imagen. Confirma que la voz y el plan permiten el uso previsto antes de publicar.
TextSpeech ofrece este flujo: vista previa en navegador → MP3 con licencia → voces narradoras de YouTube → línea de tiempo. Es una guía de trabajo, no una comparación de calidad de voces.
YouTube sin rostro con voz de IA
YouTube sin rostro combina grabaciones de pantalla, planos de recurso o diapositivas con narración. El formato por sí solo no determina legalidad ni monetización; siguen importando los derechos, el valor original y las reglas de la plataforma.
La política de monetización de canales de YouTube evalúa originalidad y autenticidad. El contenido repetitivo o producido en masa puede no ser apto; un formato recurrente no está automáticamente excluido si cada vídeo aporta contenido sustancialmente distinto. Añade demostraciones, análisis o explicaciones propias, en lugar de limitarte a reunir textos y clips ajenos.
Una voz constante por serie puede facilitar la producción. Guarda la voz, los ajustes y la licencia; también puedes planificar un cambio de narrador.
Qué necesitas
- Un guion terminado, no apuntes. El TTS lee exactamente lo que escribes.
- TextSpeech Studio: más de 1.000 voces y 11 idiomas de interfaz.
- CapCut, Premiere o DaVinci Resolve.
- Plan de pago (Basic, Pro o Ultra) si el vídeo tendrá anuncios o necesitas descargar MP3. Free: hasta 500 caracteres por generación, solo vista previa, sin uso comercial. Consulta los precios.
- Opcional: etiquetas de emoción en los planes de pago para enfatizar sin acelerar toda la toma.
Prueba un párrafo real en Studio antes de comprometerte con un guion de 10 minutos. Si sigue sonando como una entrada de blog, primero reescríbelo para escucharlo.
Escribe el guion para hablar
El texto a voz no improvisa. Usa frases cortas, números escritos con palabras y evita preámbulos como «bienvenidos de nuevo al canal».
| Duración del vídeo | Palabras a 140 ppm (tutoriales) | Palabras a 160 ppm (explicaciones) | ¿Cabe en una generación Free de 500 caracteres? |
|---|---|---|---|
| 60 segundos | 140 | 160 | No: usa un bloque de pago o divídelo |
| 8 minutos | 1.120 | 1.280 | No: usa un plan de pago; divide solo si supera el límite de caracteres |
| 10 minutos | 1.400 | 1.600 | No: usa un plan de pago; divide solo si supera el límite de caracteres |
Reglas que cambian el archivo:
- Una idea por frase. Los puntos crean pausas que respeta el TTS; las cadenas de comas a menudo no.
- Escribe lo que quieres que se pronuncie:
10%→ten percent; usa escritura fonética para nombres de productos si hace falta. - Presenta pronto el propósito o la pregunta principal. Revisa tus propios datos de retención tras publicar; aquí no se establece un umbral universal de 12 segundos.
- Genera primero el audio y luego monta los planos de recurso. Encajar la voz en imágenes ya cerradas crea silencios.
Ejemplo de inicio directo (tutorial de CapCut)
La mayoría de los subtítulos de CapCut fallan por una razón. Subtitulas automáticamente una habitación ruidosa y después pasas veinte minutos corrigiendo nombres. Genera primero la voz en off. Después subtitula el archivo limpio.
El original tiene 27 palabras (~12 segundos a 140 ppm). Genera solo este bloque en Free para probar el ritmo. Si no funciona a 1.0x en el altavoz del móvil, no generes todavía el resto del guion.
Genera la locución con IA en Studio
Captura real de Studio en inglés: ejemplo de 171/500 caracteres a 1.00x, antes de elegir voz o generar. Muestra la preparación, no una prueba de calidad de audio.
- Abre Studio o empieza en la página del generador de voces para YouTube para filtrar voces de narración.
- Pega una sección que respete el límite. Basic/Pro permite 15.000 caracteres por generación. Un guion en inglés de 8 minutos suele caber; divídelo si su número real de caracteres supera el límite, o de forma opcional para facilitar la edición.
- Compara dos voces con el mismo párrafo y velocidad. Elige por pronunciación y claridad; las propuestas siguientes son puntos de partida, no reglas por tipo de canal.
- Escucha 20–30 segundos. Ajusta ligeramente la velocidad (0.95–1.0x para tutoriales largos) antes de gastar créditos en toda la sección.
- Con un plan de pago, exporta MP3. WAV solo si vas a mezclar en una DAW.
Si una palabra falla, corrige el texto, no toda la sección. La escritura fonética y una frase más corta funcionan mejor que regenerar 1.000 palabras.
Ideas de voz y velocidad para probar
| Canal | Dirección de voz | Velocidad |
|---|---|---|
| Software / tutoriales | Cálida, clara, tono medio | 0.95–1.0x |
| Finanzas / noticias | Más grave y estable | 1.0x |
| Documentales / listas | Narrador neutro; energía solo en el gancho | 1.0x |
| YouTube de estilo Shorts | Más brillante, frases más cortas | 1.05–1.15x |
Los planes de pago incluyen etiquetas de emoción para enfatizar frases concretas, útiles cuando una frase necesita energía sin acelerar todo el párrafo.
Exporta MP3 y respeta los límites de generación
Límites de los planes de TextSpeech (septiembre de 2026):
| Plan | Caracteres / generación | Descarga MP3 | Uso comercial |
|---|---|---|---|
| Free | 500 | Solo vista previa | No |
| Basic / Pro | 15.000 | Sí | Sí |
| Ultra | 30.000 | Sí | Sí |
Un guion de YouTube de 10 minutos (~1.400 palabras en inglés) suele caber en una generación de 15.000 caracteres. Comprueba el número real de caracteres; divide si supera el límite o, de forma opcional, para editar. Nombra los archivos por sección: 01-hook.mp3, 02-demo.mp3, 03-close.mp3. Únelos en la línea de tiempo.
Más detalles sobre la exportación: texto a MP3.
Voz en off en CapCut: importar y editar primero el audio
El TTS integrado de CapCut puede encajar en tu trabajo. Si quieres un archivo independiente reutilizable, importa un MP3. Comprueba la disponibilidad, las opciones de exportación y las condiciones de la voz en tu versión antes de elegirla para una serie.
- Nuevo proyecto → importa primero el MP3 de Studio. Anota su duración: marca tu tiempo.
- Importa después las grabaciones de pantalla o los planos de recurso. Monta la imagen siguiendo el audio.
- Divide el audio entre secciones (cada H2 del guion) para que corregir un párrafo no obligue a reconstruir toda la línea de tiempo.
- Crea subtítulos desde el guion o corrige los automáticos comparándolos con él. Revisa nombres de productos y ajusta cada subtítulo al audio final.
- Baja la música durante la voz, escucha su inteligibilidad y comprueba que no sature. Una reducción de 12–18 dB puede ser un punto de partida; el nivel adecuado depende de las grabaciones.
- Exporta a 1080p (o 4K si el original es 4K). Audio AAC, 48 kHz.
Premiere y DaVinci siguen el mismo orden: base de audio → imagen → subtítulos.
Si ya usaste CapCut TTS, consérvalo si cumple tus necesidades y la licencia. Para compararlo con un MP3, silencia la pista original, alinea la nueva al inicio y comprueba los tiempos antes de borrar nada.
Monetizar una voz en off con IA en YouTube
Al subir el vídeo, consulta los requisitos de declaración de IA. Las instrucciones oficiales actuales de YouTube Studio indican Atributos → Uso de IA: elige Sí si el contenido cumple los criterios de generación o alteración significativa y realista mediante IA; de lo contrario, No. No todo uso de TTS exige declarar IA. La declaración no elimina por sí sola la elegibilidad para monetizar; el canal y el contenido deben cumplir las políticas.
Lista antes de activar anuncios:
- El guion y las imágenes son tuyos, no un artículo reescrito ni una lista extraída de otro sitio.
- La licencia TTS incluye uso comercial / YouTube (Basic y superiores en TextSpeech; Free no).
- Has exportado un MP3 real de Studio, no una grabación de pantalla del reproductor de vista previa.
- Los subtítulos se han subido a partir del guion.
- La música tiene licencia y está por debajo de la voz.
- Has declarado honestamente el uso de IA donde lo pide el proceso de subida.
Comprueba por separado los derechos del guion, las imágenes, la música y la voz elegida. Una suscripción TTS no concede derechos sobre material ajeno, y el permiso de copyright es distinto de la revisión de contenido reutilizado de YouTube.
Errores habituales
- Elegir una voz publicitaria enérgica sin comprobar si encaja en todo el tutorial.
- Pegar sin comprobar el número real de caracteres frente al límite de 500 (Free) o 15.000 (Basic/Pro).
- Editar primero el vídeo y después forzar al TTS a encajar en cortes arbitrarios.
- No registrar la voz y los ajustes, dificultando reproducirlos en episodios posteriores con cualquier herramienta.
- Publicar 30 vídeos de «top 10» casi idénticos con la misma plantilla: ese es el patrón de producción en masa que vigila YouTube.
- Escuchar solo con auriculares de estudio. La prueba real es el altavoz del móvil a 1.0x.
Preguntas frecuentes
¿YouTube desmonetiza las voces de IA?
El TTS por sí solo no determina la elegibilidad. YouTube revisa el canal y su contenido según las políticas de monetización, incluida la originalidad y el contenido reutilizado. Tener licencia no garantiza monetización.
¿Puedo usar locución con IA en un canal de YouTube sin rostro?
Sí, si el vídeo aporta valor original: tu grabación de pantalla, tu prueba y tu montaje, no diapositivas con texto extraído de otros sitios.
¿Cómo añado locución con IA en CapCut?
Genera un MP3 en Studio, impórtalo a CapCut, monta los planos de recurso al ritmo del audio y crea los subtítulos desde el guion. CapCut TTS es opcional para un borrador. En Premiere se sigue el mismo orden.
¿MP3 o WAV para YouTube?
MP3 para CapCut y la subida a YouTube. WAV si primero ecualizas o comprimes en una DAW.
¿Necesito clonar mi propia voz?
No. Puedes elegir una voz de biblioteca con licencia. Revisa sus condiciones y evita suplantar a alguien sin el permiso correspondiente.
¿Cuánto cuesta la voz en off con IA para YouTube?
La vista previa es gratuita dentro de los puntos de registro diario. MP3 + uso comercial empiezan en Basic. Un vídeo de 10 minutos tiene unas 1.400 palabras en inglés y suele caber en una generación de 15.000 caracteres. Comprueba el número real: dividir solo es necesario si supera el límite, y es opcional para facilitar la edición.
Genera los primeros 30 segundos en Studio. Termina el guion solo cuando ese párrafo suene como un narrador al que seguirías.


