• Voz En Off Con IA
  • Locución Con IA

Cómo añadir una voz en off con IA a YouTube con CapCut

Voz en off con IA para YouTube: prueba el guion, confirma los derechos, exporta MP3 y edita primero el audio en CapCut. Compara el TTS integrado con un archivo importado según tu flujo.

Equipo de TextSpeech10 min de lectura
Escritorio con lámpara, auriculares y monitor que muestra una línea de tiempo de audio

Respuesta breve: La voz en off con IA (también locución con IA) convierte un guion en narración. Escribe para escuchar, prueba una sección, confirma los derechos comerciales, exporta MP3 y edita primero el audio en CapCut. El TTS integrado también puede servir para una serie; compara disponibilidad de voces, exportación y condiciones vigentes.

Voz en off y locución con IA significan lo mismo. Elige entre una voz del editor y un archivo separado según la reutilización y el control de edición que necesites.

Última actualización: 14 de septiembre de 2026. Revisión de fuentes: documentación oficial de YouTube sobre declaraciones y monetización consultada el 14 de septiembre de 2026. Las voces y los pasos de edición son sugerencias, no resultados de pruebas auditivas, experimentos de retención ni una prueba de subida con sesión iniciada.

Voz en off con IA frente a YouTube TTS y CapCut TTS

FuenteQué esAdecuado paraPoco adecuado para
Voz en off / locución con IA (estudio en el navegador)Guion → vista previa → MP3Narrador fijo de una serie, licencia comercial, la misma voz la semana siguienteComprueba las condiciones de reutilización y exportación de la voz
YouTube TTS / voz de IA de YouTubeSubtítulos, doblaje automático o una voz integrada en el proceso de subidaAccesibilidad y borradoresComprueba las condiciones de reutilización y exportación de la voz
CapCut TTS / voz en off de CapCutVoces dentro del editorBorrador vertical, prueba de 20 segundosComprueba las condiciones de reutilización y exportación de la voz
TextSpeechVista previa de Studio en Free; MP3 + uso comercial en Basic y superioresProbar voces y después exportarSin aplicación de escritorio; 15.000 caracteres por generación de pago

Conclusión: Prueba el montaje empezando por el audio: coloca la narración y adapta la imagen. Confirma que la voz y el plan permiten el uso previsto antes de publicar.

TextSpeech ofrece este flujo: vista previa en navegador → MP3 con licencia → voces narradoras de YouTube → línea de tiempo. Es una guía de trabajo, no una comparación de calidad de voces.

YouTube sin rostro con voz de IA

YouTube sin rostro combina grabaciones de pantalla, planos de recurso o diapositivas con narración. El formato por sí solo no determina legalidad ni monetización; siguen importando los derechos, el valor original y las reglas de la plataforma.

La política de monetización de canales de YouTube evalúa originalidad y autenticidad. El contenido repetitivo o producido en masa puede no ser apto; un formato recurrente no está automáticamente excluido si cada vídeo aporta contenido sustancialmente distinto. Añade demostraciones, análisis o explicaciones propias, en lugar de limitarte a reunir textos y clips ajenos.

Una voz constante por serie puede facilitar la producción. Guarda la voz, los ajustes y la licencia; también puedes planificar un cambio de narrador.

Qué necesitas

  • Un guion terminado, no apuntes. El TTS lee exactamente lo que escribes.
  • TextSpeech Studio: más de 1.000 voces y 11 idiomas de interfaz.
  • CapCut, Premiere o DaVinci Resolve.
  • Plan de pago (Basic, Pro o Ultra) si el vídeo tendrá anuncios o necesitas descargar MP3. Free: hasta 500 caracteres por generación, solo vista previa, sin uso comercial. Consulta los precios.
  • Opcional: etiquetas de emoción en los planes de pago para enfatizar sin acelerar toda la toma.

Prueba un párrafo real en Studio antes de comprometerte con un guion de 10 minutos. Si sigue sonando como una entrada de blog, primero reescríbelo para escucharlo.

Escribe el guion para hablar

El texto a voz no improvisa. Usa frases cortas, números escritos con palabras y evita preámbulos como «bienvenidos de nuevo al canal».

Duración del vídeoPalabras a 140 ppm (tutoriales)Palabras a 160 ppm (explicaciones)¿Cabe en una generación Free de 500 caracteres?
60 segundos140160No: usa un bloque de pago o divídelo
8 minutos1.1201.280No: usa un plan de pago; divide solo si supera el límite de caracteres
10 minutos1.4001.600No: usa un plan de pago; divide solo si supera el límite de caracteres

Reglas que cambian el archivo:

  • Una idea por frase. Los puntos crean pausas que respeta el TTS; las cadenas de comas a menudo no.
  • Escribe lo que quieres que se pronuncie: 10%ten percent; usa escritura fonética para nombres de productos si hace falta.
  • Presenta pronto el propósito o la pregunta principal. Revisa tus propios datos de retención tras publicar; aquí no se establece un umbral universal de 12 segundos.
  • Genera primero el audio y luego monta los planos de recurso. Encajar la voz en imágenes ya cerradas crea silencios.

Ejemplo de inicio directo (tutorial de CapCut)

La mayoría de los subtítulos de CapCut fallan por una razón. Subtitulas automáticamente una habitación ruidosa y después pasas veinte minutos corrigiendo nombres. Genera primero la voz en off. Después subtitula el archivo limpio.

El original tiene 27 palabras (~12 segundos a 140 ppm). Genera solo este bloque en Free para probar el ritmo. Si no funciona a 1.0x en el altavoz del móvil, no generes todavía el resto del guion.

Genera la locución con IA en Studio

Captura real de Studio en inglés: ejemplo de 171/500 caracteres a 1.00x, antes de elegir voz o generar. Muestra la preparación, no una prueba de calidad de audio.

Captura real de Studio en inglés: ejemplo de 171/500 caracteres a 1.00x, antes de elegir voz o generar. Muestra la preparación, no una prueba de calidad de audio.

  1. Abre Studio o empieza en la página del generador de voces para YouTube para filtrar voces de narración.
  2. Pega una sección que respete el límite. Basic/Pro permite 15.000 caracteres por generación. Un guion en inglés de 8 minutos suele caber; divídelo si su número real de caracteres supera el límite, o de forma opcional para facilitar la edición.
  3. Compara dos voces con el mismo párrafo y velocidad. Elige por pronunciación y claridad; las propuestas siguientes son puntos de partida, no reglas por tipo de canal.
  4. Escucha 20–30 segundos. Ajusta ligeramente la velocidad (0.95–1.0x para tutoriales largos) antes de gastar créditos en toda la sección.
  5. Con un plan de pago, exporta MP3. WAV solo si vas a mezclar en una DAW.

Si una palabra falla, corrige el texto, no toda la sección. La escritura fonética y una frase más corta funcionan mejor que regenerar 1.000 palabras.

Ideas de voz y velocidad para probar

CanalDirección de vozVelocidad
Software / tutorialesCálida, clara, tono medio0.95–1.0x
Finanzas / noticiasMás grave y estable1.0x
Documentales / listasNarrador neutro; energía solo en el gancho1.0x
YouTube de estilo ShortsMás brillante, frases más cortas1.05–1.15x

Los planes de pago incluyen etiquetas de emoción para enfatizar frases concretas, útiles cuando una frase necesita energía sin acelerar todo el párrafo.

Exporta MP3 y respeta los límites de generación

Límites de los planes de TextSpeech (septiembre de 2026):

PlanCaracteres / generaciónDescarga MP3Uso comercial
Free500Solo vista previaNo
Basic / Pro15.000
Ultra30.000

Un guion de YouTube de 10 minutos (~1.400 palabras en inglés) suele caber en una generación de 15.000 caracteres. Comprueba el número real de caracteres; divide si supera el límite o, de forma opcional, para editar. Nombra los archivos por sección: 01-hook.mp3, 02-demo.mp3, 03-close.mp3. Únelos en la línea de tiempo.

Más detalles sobre la exportación: texto a MP3.

Voz en off en CapCut: importar y editar primero el audio

El TTS integrado de CapCut puede encajar en tu trabajo. Si quieres un archivo independiente reutilizable, importa un MP3. Comprueba la disponibilidad, las opciones de exportación y las condiciones de la voz en tu versión antes de elegirla para una serie.

  1. Nuevo proyecto → importa primero el MP3 de Studio. Anota su duración: marca tu tiempo.
  2. Importa después las grabaciones de pantalla o los planos de recurso. Monta la imagen siguiendo el audio.
  3. Divide el audio entre secciones (cada H2 del guion) para que corregir un párrafo no obligue a reconstruir toda la línea de tiempo.
  4. Crea subtítulos desde el guion o corrige los automáticos comparándolos con él. Revisa nombres de productos y ajusta cada subtítulo al audio final.
  5. Baja la música durante la voz, escucha su inteligibilidad y comprueba que no sature. Una reducción de 12–18 dB puede ser un punto de partida; el nivel adecuado depende de las grabaciones.
  6. Exporta a 1080p (o 4K si el original es 4K). Audio AAC, 48 kHz.

Premiere y DaVinci siguen el mismo orden: base de audio → imagen → subtítulos.

Si ya usaste CapCut TTS, consérvalo si cumple tus necesidades y la licencia. Para compararlo con un MP3, silencia la pista original, alinea la nueva al inicio y comprueba los tiempos antes de borrar nada.

Monetizar una voz en off con IA en YouTube

Al subir el vídeo, consulta los requisitos de declaración de IA. Las instrucciones oficiales actuales de YouTube Studio indican Atributos → Uso de IA: elige Sí si el contenido cumple los criterios de generación o alteración significativa y realista mediante IA; de lo contrario, No. No todo uso de TTS exige declarar IA. La declaración no elimina por sí sola la elegibilidad para monetizar; el canal y el contenido deben cumplir las políticas.

Lista antes de activar anuncios:

  • El guion y las imágenes son tuyos, no un artículo reescrito ni una lista extraída de otro sitio.
  • La licencia TTS incluye uso comercial / YouTube (Basic y superiores en TextSpeech; Free no).
  • Has exportado un MP3 real de Studio, no una grabación de pantalla del reproductor de vista previa.
  • Los subtítulos se han subido a partir del guion.
  • La música tiene licencia y está por debajo de la voz.
  • Has declarado honestamente el uso de IA donde lo pide el proceso de subida.

Comprueba por separado los derechos del guion, las imágenes, la música y la voz elegida. Una suscripción TTS no concede derechos sobre material ajeno, y el permiso de copyright es distinto de la revisión de contenido reutilizado de YouTube.

Errores habituales

  • Elegir una voz publicitaria enérgica sin comprobar si encaja en todo el tutorial.
  • Pegar sin comprobar el número real de caracteres frente al límite de 500 (Free) o 15.000 (Basic/Pro).
  • Editar primero el vídeo y después forzar al TTS a encajar en cortes arbitrarios.
  • No registrar la voz y los ajustes, dificultando reproducirlos en episodios posteriores con cualquier herramienta.
  • Publicar 30 vídeos de «top 10» casi idénticos con la misma plantilla: ese es el patrón de producción en masa que vigila YouTube.
  • Escuchar solo con auriculares de estudio. La prueba real es el altavoz del móvil a 1.0x.

Preguntas frecuentes

¿YouTube desmonetiza las voces de IA?

El TTS por sí solo no determina la elegibilidad. YouTube revisa el canal y su contenido según las políticas de monetización, incluida la originalidad y el contenido reutilizado. Tener licencia no garantiza monetización.

¿Puedo usar locución con IA en un canal de YouTube sin rostro?

Sí, si el vídeo aporta valor original: tu grabación de pantalla, tu prueba y tu montaje, no diapositivas con texto extraído de otros sitios.

¿Cómo añado locución con IA en CapCut?

Genera un MP3 en Studio, impórtalo a CapCut, monta los planos de recurso al ritmo del audio y crea los subtítulos desde el guion. CapCut TTS es opcional para un borrador. En Premiere se sigue el mismo orden.

¿MP3 o WAV para YouTube?

MP3 para CapCut y la subida a YouTube. WAV si primero ecualizas o comprimes en una DAW.

¿Necesito clonar mi propia voz?

No. Puedes elegir una voz de biblioteca con licencia. Revisa sus condiciones y evita suplantar a alguien sin el permiso correspondiente.

¿Cuánto cuesta la voz en off con IA para YouTube?

La vista previa es gratuita dentro de los puntos de registro diario. MP3 + uso comercial empiezan en Basic. Un vídeo de 10 minutos tiene unas 1.400 palabras en inglés y suele caber en una generación de 15.000 caracteres. Comprueba el número real: dividir solo es necesario si supera el límite, y es opcional para facilitar la edición.

Genera los primeros 30 segundos en Studio. Termina el guion solo cuando ese párrafo suene como un narrador al que seguirías.

Sigue leyendo

Prueba la frase en Studio

Elige una voz, pega el guion y escucha la toma antes de exportar.