Guias
Voz em off com IA para vídeos: do roteiro ao vídeo
Equipe da Voizum · Atualizado · 11 min de leitura
Uma voz em off com IA se faz em quatro passos: roteiro, voz, montagem e publicação. Este guia põe números em cada um: quantos caracteres enchem um minuto, que voz combina com cada tipo de vídeo, como sincronizar o MP3 no CapCut, Premiere, DaVinci ou PowerPoint, em que volume vai a música e o que YouTube e TikTok pedem se a voz é sintética.
Como fazer um vídeo com voz em off com IA, passo a passo
Primeiro o roteiro, depois a voz e por último a imagem. Quem monta a imagem antes acaba esticando planos ou cortando frases para a voz caber. Com a voz pronta, você corta a imagem no ritmo da narração e encaixa de primeira.
O fluxo é o mesmo para um Short de 40 segundos e para um documentário de uma hora:
- 1Escreva o roteiro inteiro em um documento, pensando no ouvido. Mais abaixo vai como.
- 2Calcule a duração: cerca de 1.000 caracteres por minuto. Se o vídeo precisa durar 8 minutos, mire em uns 8.000.
- 3Cole o texto no gerador ou envie o arquivo (txt, md, srt, pdf, docx) e escolha a voz. Ouça a amostra com uma frase do seu próprio roteiro, não com a de exemplo.
- 4Gere e ouça o resultado. Se quiser mudar algo, mude no texto e gere de novo só essa parte.
- 5Baixe o MP3 e importe no seu editor. Coloque em uma trilha de áudio própria, desde o segundo zero.
- 6Corte e posicione a imagem seguindo a voz: a cada mudança de ideia, uma mudança de plano.
- 7Adicione música em outra trilha, abaixe-a para ficar sob a voz e ative a redução automática (ducking) se o seu editor tiver.
- 8Gere legendas: nas redes, boa parte do público assiste aos vídeos sem som.
- 9Exporte, meça o volume final e publique. Se a plataforma pedir, marque o conteúdo como feito com IA.
Quanto texto você precisa: caracteres por minuto
Em português, conte caracteres. É o que qualquer gerador de voz mede e não depende de quão longas são as suas palavras. A conta redonda: 1.000 caracteres, com espaços, por minuto de áudio.
A referência clássica em palavras vem do inglês: o National Center for Voice and Speech estima cerca de 150 palavras por minuto na fala dos EUA. Em português as palavras são um pouco mais longas e esse número não se aplica direto. O confiável é gerar um minuto de teste com a voz que você vai usar e ajustar o roteiro ao que durar.
| Duração do vídeo | Caracteres de roteiro (conta redonda) | Faixa real conforme a voz | Créditos |
|---|---|---|---|
| 1 min | 1.000 | 870 – 1.290 | 100 |
| 3 min | 3.000 | 2.610 – 3.870 | 180 |
| 8 min | 8.000 | 6.960 – 10.320 | 480 |
| 15 min | 15.000 | 13.050 – 19.350 | 900 |
| 30 min | 30.000 | 26.100 – 38.700 | 1.800 |
| 1 hora | 60.000 | 52.200 – 77.400 | 3.600 |
Como escrever um roteiro para voz em off
Quem ouve não pode voltar para reler. Cada frase precisa ser entendida de primeira.
- Frases de 15 a 25 palavras, no máximo. Se uma frase precisa de duas vírgulas e um parêntese, divida em duas.
- Uma ideia por frase e o dado importante no final, que é onde cai o acento da frase.
- Valores, datas, horas e preços são lidos bem sozinhos. Já siglas e símbolos estranhos, escreva como você quer que soem: “dáblio, dáblio, dáblio”, ou “três vezes” em vez de “3x”.
- A pontuação marca o ritmo. O ponto faz pausa e a vírgula deixa respirar; um roteiro sem pontos é lido de corrido.
- Nada de listas longas lidas em voz alta. Passando de quatro itens, as pessoas se perdem: coloque na tela e deixe a voz dizer só os dois que importam.
- Leia o roteiro em voz alta antes de gerar. Onde você tropeça, a voz também soa forçada.
O gancho nos vídeos curtos
No TikTok, nos Reels e nos Shorts, a primeira frase decide se as pessoas ficam. Comece pela promessa ou pelo dado mais chamativo, nunca por “oi, pessoal, hoje vamos ver”. A apresentação, se for preciso, vem depois do gancho.
Pausas sob medida
Precisa de um silêncio exato enquanto entra um gráfico? Escreva <#1.5#> entre as duas frases, com os segundos que quiser. A marca não é lida nem cobrada. O espaço geral entre as frases é escolhido à parte, nos ajustes, de mais seguido a mais pausado.
Que voz escolher conforme o tipo de vídeo
O tom é definido pela voz antes da imagem. Escolha com o seu roteiro na frente: a voz que vai bem em um tutorial pode adormecer um anúncio.
| Tipo de vídeo | Que voz funciona | Ritmo | Dica |
|---|---|---|---|
| Documentário, história, true crime | Narrador grave e pausado | Lento | Frases longas bem pontuadas e pausas antes de cada revelação |
| Tutorial, curso, explicação | Voz clara e próxima, sem teatro | Médio | Um passo por frase; o que aparece na tela é chamado igual ao do roteiro |
| Anúncio e promoção | Voz com energia comercial | Médio-rápido | Produto e benefício nos primeiros 5 segundos; a chamada para ação no final e sozinha |
| Conto infantil e narrativa | Voz calorosa e expressiva | Lento | Aumente a expressividade nos ajustes e deixe pausas nas trocas de cena |
| Shorts, Reels e TikTok | Voz conversacional, como alguém contando para você | Rápido | Gancho na primeira frase e nenhuma introdução |
| Notícias e resumos | Voz de locutor, neutra | Médio | Dados e datas escritos como se falam |
Voz da biblioteca ou a sua própria voz clonada?
Se as pessoas já conhecem a sua voz, clone-a e os vídeos continuarão soando como você nos dias em que não gravar. Em um canal sem rosto nem voz conhecida, os chamados faceless, uma voz da biblioteca poupa esse passo e você a troca por série ou por idioma.
Vozes da biblioteca
São mais de 300 vozes em 7 idiomas: português, inglês, espanhol, alemão, francês, italiano e russo. Cada uma tem a sua amostra para ouvir antes, e você pode ajustar velocidade, volume e expressividade e salvar esses ajustes na voz para que todos os seus vídeos soem igual.
A sua voz clonada
Você precisa de 15 a 60 segundos de gravação limpa de uma só pessoa. Clonar custa 199 créditos uma única vez e exige já ter comprado créditos alguma vez. A entonação é copiada: se você grava a amostra com voz monótona, a narração sai monótona. Você só pode clonar a sua voz ou a de alguém que tenha dado permissão.
- Grave em um cômodo com móveis ou cortinas, sem música nem ruído de fundo.
- Corte a gravação em uma pausa, nunca no meio de uma palavra, e deixe um pouco menos de um segundo de silêncio no final.
- Não repita um trecho curto em loop para alongá-lo: piora o clone em vez de melhorar.
Como colocar a voz em off no CapCut, Premiere, DaVinci e PowerPoint
Os menus mudam, o princípio não: o MP3 vai na sua própria trilha de áudio, começa no segundo zero e a imagem se ajusta a ele.
CapCut (computador e celular)
É o caminho mais rápido para TikTok, Reels e Shorts.
- Clique em Importar e adicione o vídeo ou as imagens e o MP3 da voz.
- Arraste o MP3 para a linha do tempo, abaixo da trilha de vídeo, alinhado ao início.
- Amplie a linha do tempo e corte os clipes de imagem (Dividir) onde a voz muda de ideia.
- Para a música, selecione-a e abaixe o volume no painel de áudio; com quadros-chave de volume você pode abaixá-la só enquanto há fala.
- Em Legendas, escolha Legendas automáticas com o idioma da voz e revise o texto gerado.
Premiere Pro
- Arquivo > Importar (Ctrl+I) e arraste o MP3 para a trilha A1; a música, para a A2.
- No painel de som essencial (Essential Sound), marque a voz como diálogo e a música como música.
- Com a música selecionada, ative o ducking em relação ao diálogo, ajuste quanto a música abaixa e gere os quadros-chave.
- Monte os planos na trilha de vídeo seguindo as frases da voz.
DaVinci Resolve
- Importe o MP3 no Media Pool e arraste-o para uma trilha de áudio na página Edit.
- Coloque a música em outra trilha.
- Na página Fairlight, abra a dinâmica da trilha de música, ative o compressor e escolha como fonte de sidechain a trilha da voz.
- Abaixe o limiar até a música se afastar quando a voz entra; uma razão de 3:1 a 5:1 é um bom ponto de partida.
PowerPoint
O mais prático é um áudio por slide: gere um trecho para cada um (com “Encadear áudios” dá para gerar até 100 de uma vez).
- Em cada slide: Inserir > Áudio > Áudio em Meu PC e escolha o MP3 dele.
- Com o ícone de áudio selecionado, na guia Reprodução, defina Iniciar > Automaticamente.
- Em Transições, desmarque Ao clicar com o mouse e defina Após com a duração desse áudio.
- Para transformar em vídeo: Arquivo > Exportar > Criar um Vídeo, com Usar Narrações e Tempos Gravados, em MP4.
Em que volume vai a música de fundo?
Uma referência prática de edição: picos da voz entre −12 e −6 dB e a música uns 20 dB abaixo enquanto há fala. Se a música tem letra ou muita bateria, abaixe mais.
A redução automática, ou ducking, abaixa a música quando a voz entra e a sobe nas pausas. O Premiere faz isso no painel de som essencial e o DaVinci com um compressor com sidechain; no CapCut se faz à mão com quadros-chave de volume.
Antes de exportar, meça o volume integrado da mixagem completa em LUFS. As próprias plataformas publicam estas referências:
| Destino | Volume integrado | Pico real máximo | Fonte |
|---|---|---|---|
| Spotify (e música em streaming) | −14 LUFS | −1 dBTP | Spotify for Artists |
| Apple Podcasts | −16 LKFS (±1 dB) | −1 dBFS | Apple Podcasts for Creators |
Horas de narração em um único áudio
Um documentário de uma hora, um curso ou um audiolivro são gerados de uma vez: cada áudio aceita até 600.000 caracteres, cerca de 10 horas de voz (entre 7 e 12 conforme a rapidez da voz). Sem dividir o roteiro, não há duas metades com tom diferente.
Se você prefere várias peças (um áudio por capítulo ou por slide), “Encadear áudios” gera até 100 de uma vez com os nomes. Essa função usa créditos comprados; os créditos grátis valem só para gerar no site.
Posso usar a voz com IA no YouTube, no TikTok e em anúncios?
Pode: em vídeos monetizados, anúncios e trabalhos para clientes. O que não é permitido é se passar por alguém nem conteúdo ilegal.
O YouTube pede que, no envio (opção de conteúdo alterado ou sintético), você marque o que parece real e foi gerado ou alterado com IA, como fazer uma pessoa real dizer algo que não disse. A própria lista de exceções inclui clonar a sua voz para fazer vozes em off ou dublagens e usar IA para o roteiro ou as legendas.
A monetização é outro assunto. Desde julho de 2025 o YouTube chama de “conteúdo não autêntico” o que é produzido em massa ou repetitivo, e aplica isso também a vídeos com IA feitos com modelos genéricos sem contribuição própria. Um canal de vídeos intercambiáveis corre esse risco com voz sintética ou sem ela. O que protege você é um roteiro original, com a sua pesquisa e o seu ponto de vista.
O TikTok pede para ativar o rótulo de conteúdo gerado com IA quando o conteúdo é realista, e proíbe em qualquer caso se engana sobre pessoas ou fatos reais.
Erros comuns e como fazer a voz em off soar melhor
Quase todos se resolvem reescrevendo o texto antes de gerar.
- Colar um artigo ou um PDF como está. Soa como alguém lendo um folheto em voz alta.
- Deixar “1/2” ou “S.A.” sem escrever como soam: podem ser lidos de forma inesperada.
- Escolher a voz pela frase de exemplo e não com o seu próprio roteiro.
- Música alta demais ou com letra sob a voz.
- Montar a imagem primeiro e forçar a voz a encaixar.
- Gerar 20 minutos sem ouvir antes um minuto de teste.
- Subir a expressividade ao máximo para soar mais viva: exagerada, ela perde naturalidade.
- Esquecer as legendas nos vídeos para redes.
Fontes consultadas
- YouTube: divulgação de conteúdo alterado ou sintético
- YouTube: políticas de monetização do Programa de Parcerias
- TikTok: conteúdo gerado com IA
- National Center for Voice and Speech: qualidade da voz e ritmo de fala
- Spotify for Artists: normalização de volume
- Apple Podcasts for Creators: requisitos de áudio
- Microsoft: adicionar ou excluir áudio no PowerPoint
- Microsoft: transformar uma apresentação em um vídeo
- Adobe: reduzir o áudio automaticamente no Premiere
- Larry Jordan: ducking automático no DaVinci Resolve
- CapCut: como gerar legendas
- DIY Video Studio: níveis de áudio para vídeo