Voizum

Guías

Voz en off con IA para videos: del guion al video

Equipo de Voizum · Actualizada · 11 min de lectura

Una voz en off con IA se hace en cuatro pasos: guion, voz, montaje y publicación. Esta guía pone números a cada uno: cuántos caracteres llenan un minuto, qué voz pega con cada tipo de video, cómo sincronizar el MP3 en CapCut, Premiere, DaVinci o PowerPoint, a qué volumen va la música y qué piden YouTube y TikTok si la voz es sintética.

Cómo hacer un video con voz en off con IA, paso a paso

Primero el guion, luego la voz y al final la imagen. Quien monta la imagen antes acaba estirando planos o recortando frases para que la voz quepa. Con la voz ya hecha, cortas la imagen al ritmo de la narración y cuadra a la primera.

El flujo es el mismo para un Short de 40 segundos que para un documental de una hora:

  1. 1Escribe el guion entero en un documento, pensado para el oído. Más abajo va cómo.
  2. 2Calcula la duración: unos 1.000 caracteres por minuto. Si el video tiene que durar 8 minutos, apunta a unos 8.000.
  3. 3Pega el texto en el generador o sube el archivo (txt, md, srt, pdf, docx) y elige la voz. Escucha la muestra con una frase de tu propio guion, no con la de ejemplo.
  4. 4Genera y escucha el resultado. Si quieres cambiar algo, cámbialo en el texto y genera de nuevo solo esa parte.
  5. 5Descarga el MP3 e impórtalo en tu editor. Colócalo en una pista de audio propia, desde el segundo cero.
  6. 6Corta y coloca la imagen siguiendo la voz: cada cambio de idea, un cambio de plano.
  7. 7Añade música en otra pista, bájala por debajo de la voz y activa la atenuación automática (ducking) si tu editor la tiene.
  8. 8Genera subtítulos: en redes, buena parte del público ve los videos sin sonido.
  9. 9Exporta, mide el volumen final y publica. Si la plataforma lo pide, marca el contenido como hecho con IA.

Cuánto texto necesitas: caracteres y palabras por minuto

En español, cuenta caracteres. Es lo que mide cualquier generador de voz y no depende de lo largas que sean tus palabras. La cuenta redonda: 1.000 caracteres, con espacios, por minuto de audio.

La referencia clásica en palabras viene del inglés: el National Center for Voice and Speech estima unas 150 palabras por minuto en el habla de EE. UU. En español las palabras son algo más largas y esa cifra no se traslada tal cual. Lo fiable es generar un minuto de prueba con la voz que vas a usar y ajustar el guion a lo que dure.

Duración del videoCaracteres de guion (cuenta redonda)Rango real según la vozCréditos
1 min1000870 – 1290100
3 min30002610 – 3870180
8 min80006960 – 10.320480
15 min15.00013.050 – 19.350900
30 min30.00026.100 – 38.7001800
1 hora60.00052.200 – 77.4003600
Créditos a 60 por cada 1.000 caracteres, con un mínimo de 100 por audio. Entrando con Google tienes 600 créditos gratis al mes, unos 10 minutos de voz en off.

Cómo escribir un guion para voz en off

Quien escucha no puede volver atrás a releer. Cada frase tiene que entenderse a la primera.

  • Frases de 15 a 25 palabras como máximo. Si una frase necesita dos comas y un paréntesis, pártela en dos.
  • Una idea por frase y el dato importante al final, que es donde cae el acento de la frase.
  • Las cantidades, fechas, horas y precios se leen bien solos. Las siglas y los símbolos raros, en cambio, escríbelos como quieres que suenen: «uve, uve, doble ve», o «tres veces» en vez de «3x».
  • La puntuación marca el ritmo. El punto hace pausa y la coma deja respirar; un guion sin puntos se lee de corrido.
  • Nada de listas largas leídas en voz alta. Pasados cuatro elementos, la gente se pierde: ponlos en pantalla y que la voz diga solo los dos que importan.
  • Lee el guion en voz alta tú antes de generar. Donde tú te trabas, la voz también suena forzada.

El gancho en los videos cortos

En TikTok, Reels y Shorts la primera frase decide si la gente se queda. Empieza por la promesa o por el dato más llamativo, nunca por «hola, hoy vamos a ver». La presentación, si hace falta, va después del gancho.

Pausas a medida

¿Necesitas un silencio exacto mientras entra un gráfico? Escribe <#1.5#> entre las dos frases, con los segundos que quieras. La marca no se lee ni se cobra. El espacio general entre frases se elige aparte, en los ajustes, de más seguido a más pausado.

Qué voz elegir según el tipo de video

El tono lo marca la voz antes que la imagen. Elige con tu guion delante: la voz que va bien en un tutorial puede dormir un anuncio.

Tipo de videoQué voz funcionaRitmoConsejo
Documental, historia, true crimeNarrador grave y pausadoLentoFrases largas bien puntuadas y pausas antes de cada revelación
Tutorial, curso, explicaciónVoz clara y cercana, sin teatroMedioUn paso por frase; lo que se ve en pantalla se nombra igual que en el guion
Anuncio y promociónVoz con energía comercialMedio-rápidoProducto y beneficio en los primeros 5 segundos; la llamada a la acción, al final y sola
Cuento infantil y relatoVoz cálida y expresivaLentoSube la expresividad en los ajustes y deja pausas en los cambios de escena
Shorts, Reels y TikTokVoz conversacional, como alguien que te lo cuentaRápidoGancho en la primera frase y cero introducción
Noticias y resúmenesVoz de locutor, neutraMedioDatos y fechas escritos como se dicen

¿Voz de biblioteca o tu propia voz clonada?

Si la gente ya conoce tu voz, clónala y los videos seguirán sonando a ti los días que no grabes. En un canal sin cara ni voz conocida, los llamados faceless, una voz de la biblioteca te ahorra ese paso y la cambias por serie o por idioma.

Voces de la biblioteca

Hay más de 300 voces en 7 idiomas: español, inglés, alemán, francés, portugués, italiano y ruso. Cada una tiene su muestra para escucharla antes, y puedes ajustar velocidad, volumen y expresividad y guardar esos ajustes en la voz para que todos tus videos suenen igual.

Tu voz clonada

Necesitas entre 15 y 60 segundos de grabación limpia de una sola persona. Clonar cuesta 199 créditos una sola vez y exige haber comprado créditos alguna vez. La entonación se copia: si grabas la muestra con voz monótona, la narración saldrá monótona. Solo puedes clonar tu voz o la de alguien que te haya dado permiso.

  • Graba en una habitación con muebles o cortinas, sin música ni ruido de fondo.
  • Corta la grabación en una pausa, nunca a mitad de palabra, y deja algo menos de un segundo de silencio al final.
  • No repitas un trozo corto en bucle para alargarlo: empeora el clon en vez de mejorarlo.

Cómo meter la voz en off en CapCut, Premiere, DaVinci y PowerPoint

Cambian los menús, el principio no: el MP3 va en su propia pista de audio, empieza en el segundo cero y la imagen se ajusta a él.

CapCut (escritorio y teléfono)

Es el camino más rápido para TikTok, Reels y Shorts.

  • Pulsa Importar y añade el video o las imágenes y el MP3 de la voz.
  • Arrastra el MP3 a la línea de tiempo, debajo de la pista de video, alineado al inicio.
  • Amplía la línea de tiempo y corta los clips de imagen (Dividir) donde la voz cambia de idea.
  • Para la música, selecciónala y baja su volumen en el panel de audio; con fotogramas clave de volumen puedes bajarla solo mientras se habla.
  • En Subtítulos, elige Subtítulos automáticos con el idioma de la voz y revisa el texto generado.

Premiere Pro

  • Archivo > Importar (Ctrl+I) y arrastra el MP3 a la pista A1; la música, a la A2.
  • En el panel Sonido esencial, etiqueta la voz como Diálogo y la música como Música.
  • Con la música seleccionada, activa Atenuación (Ducking), elige atenuar contra Diálogo, ajusta cuánto baja y pulsa Generar fotogramas clave.
  • Monta los planos sobre la pista de video siguiendo las frases de la voz.

DaVinci Resolve

  • Importa el MP3 en el Media Pool y arrástralo a una pista de audio en la página Edit.
  • Pon la música en otra pista distinta.
  • En la página Fairlight, abre la dinámica de la pista de música, activa el compresor y elige como fuente de sidechain la pista de la voz.
  • Baja el umbral hasta que la música se aparte cuando entra la voz; una relación de 3:1 a 5:1 es un buen punto de partida.

PowerPoint

Lo más cómodo es un audio por diapositiva: genera un fragmento por cada una (con «Encadenar audios» puedes sacar hasta 100 de una vez).

  • En cada diapositiva: Insertar > Audio > Audio en mi PC y elige su MP3.
  • Con el icono de audio seleccionado, en la pestaña Reproducción pon Inicio: Automáticamente.
  • En Transiciones, desmarca Al hacer clic con el mouse y pon en Después la duración de ese audio.
  • Para convertirlo en video: Archivo > Exportar > Crear un video, con Usar intervalos y narraciones grabados, en MP4.

¿A qué volumen va la música de fondo?

Una referencia práctica de edición: picos de la voz entre −12 y −6 dB y la música unos 20 dB por debajo mientras se habla. Si la música lleva letra o mucha batería, bájala más.

La atenuación automática, o ducking, baja la música cuando entra la voz y la sube en las pausas. Premiere lo tiene en Sonido esencial y DaVinci con un compresor con sidechain; en CapCut se hace a mano con fotogramas clave de volumen.

Antes de exportar, mide el volumen integrado de la mezcla completa en LUFS. Las propias plataformas publican estas referencias:

DestinoVolumen integradoPico real máximoFuente
Spotify (y música en streaming)−14 LUFS−1 dBTPSpotify for Artists
Apple Podcasts−16 LKFS (±1 dB)−1 dBFSApple Podcasts for Creators
LUFS y LKFS miden lo mismo. YouTube no publica una cifra oficial; para video, una mezcla entre −14 y −16 LUFS con picos por debajo de −1 dB suena bien en casi todas partes.

Horas de narración en un solo audio

Un documental de una hora, un curso o un audiolibro se generan de una vez: cada audio admite hasta 600.000 caracteres, unas 10 horas de voz (entre 7 y 12 según lo rápida que sea la voz). Sin trocear el guion, no hay dos mitades que suenen con un tono distinto.

Si prefieres varias piezas (un audio por capítulo o por diapositiva), «Encadenar audios» genera hasta 100 de una vez con sus nombres. Esa función usa créditos comprados; el bono gratis vale solo para generar en la web.

¿Puedo usar la voz con IA en YouTube, TikTok y anuncios?

Sí: en videos monetizados, anuncios y trabajos para clientes. Lo que no está permitido es suplantar a alguien ni el contenido ilegal.

YouTube pide marcar en la subida (opción de contenido alterado o sintético) lo que parece real y está generado o alterado con IA, como hacer que una persona real diga algo que no dijo. Su propia lista de excepciones incluye clonar tu propia voz para hacer voces en off o doblajes, y usar IA para el guion o los subtítulos.

La monetización es otro asunto. Desde julio de 2025 YouTube llama «contenido no auténtico» a lo producido en serie o repetitivo, y lo aplica también a videos con IA hechos con plantillas genéricas sin aportación propia. Un canal de videos intercambiables corre ese riesgo con voz sintética o sin ella. Lo que te protege es un guion original, con tu investigación y tu punto de vista.

TikTok pide activar la etiqueta de contenido generado con IA cuando el contenido es realista, y lo prohíbe en cualquier caso si engaña sobre personas o hechos reales.

Errores frecuentes y cómo hacer que la voz en off suene mejor

Casi todos se arreglan reescribiendo el texto antes de generar.

  • Pegar un artículo o un PDF tal cual. Suena a alguien leyendo un folleto en voz alta.
  • Dejar «1/2» o «S.A.» sin escribir como suenan: pueden leerse de forma inesperada.
  • Elegir la voz por su frase de ejemplo y no con tu propio guion.
  • Música demasiado alta o con letra debajo de la voz.
  • Montar la imagen primero y forzar la voz a encajar.
  • Generar 20 minutos sin escuchar antes un minuto de prueba.
  • Subir la expresividad al máximo para que suene más viva: pasarse le quita naturalidad.
  • Olvidar los subtítulos en los videos para redes.

Fuentes consultadas

  1. YouTube: divulgación de contenido alterado o sintético
  2. YouTube: políticas de monetización del Programa de Socios
  3. TikTok: contenido generado con IA
  4. National Center for Voice and Speech: calidad de voz y ritmo de habla
  5. Spotify for Artists: normalización de volumen
  6. Apple Podcasts for Creators: requisitos de audio
  7. Microsoft: agregar o eliminar audio en PowerPoint
  8. Microsoft: convertir una presentación en un video
  9. Adobe: atenuar audio automáticamente en Premiere
  10. Larry Jordan: ducking automático en DaVinci Resolve
  11. CapCut: cómo generar subtítulos
  12. DIY Video Studio: niveles de audio para video
  13. Fundéu: «voz en off», con dos efes

También te puede servir

Preguntas frecuentes

¿Qué es una voz en off?
La que narra sobre la imagen sin que se vea a quien habla, como en un documental o un tutorial. Con IA sale de un texto en lugar de una grabación.
¿Se puede monetizar en YouTube un video con voz de IA?
Sí. YouTube no prohíbe la voz sintética; lo que no monetiza es el contenido producido en serie o repetitivo sin aportación propia. Si el video muestra algo realista que no ocurrió, hay que marcarlo como contenido alterado o sintético al subirlo.
¿Cómo hacer una voz en off con IA gratis?
Entrando con Google tienes 600 créditos gratis cada mes, unos 10 minutos de voz, para generar en la web y descargar el MP3. Para clips muy cortos también puedes usar la voz integrada de CapCut.
¿Cómo narrar un video en CapCut?
Genera la voz, impórtala en CapCut con Importar y arrástrala a la línea de tiempo debajo del video. Corta la imagen donde la voz cambia de idea y añade Subtítulos automáticos al final.
¿Cómo narrar un video con mi voz sin grabarla cada vez?
Clona tu voz una vez con 15 a 60 segundos de grabación limpia. Después escribes el guion y tu voz lo lee, también en otros idiomas.
¿Cuántas palabras tiene un minuto de voz en off?
Unas 150 en inglés. En español es más fiable contar caracteres: unos 1.000 por minuto, entre 870 y 1.290 según lo rápida que sea la voz.
¿Se escribe voz en off o voz en of?
Voz en off, con dos efes: «off» es la palabra inglesa y así la recoge el diccionario. También se usa «voz superpuesta» o el anglicismo voice-over.

Más guías

Escribe tu texto y escúchalo con voz real

Si entras con Google, te regalamos 600 créditos cada mes: unos 10 minutos de audio.