Guias
Converter texto em voz com IA: passo a passo
Equipe da Voizum · Atualizado · 12 min de leitura
O texto para voz transforma um texto escrito em áudio falado. Há alguns anos isso soava como uma gravação de telemarketing. As vozes neurais de hoje respiram entre as frases e sobem o tom no fim das perguntas. Este guia mostra como escolher a ferramenta, com o preço por minuto de cada uma ao lado, como escrever números e siglas para a voz não tropeçar, quanto dura o áudio conforme o número de caracteres e o que você pode fazer com ele dentro da lei.
O que é texto para voz e por que ele não soa mais como robô
Você usa isso sem pensar quando o GPS manda virar na próxima rotatória. Texto para voz, ou TTS (do inglês text to speech), é qualquer sistema que lê um texto em voz alta e devolve o som.
As vozes antigas eram feitas colando pedaços de gravação ou calculando o som com regras fixas. Daí o tom monótono e os cortes entre as sílabas: o sistema não entendia a frase, só a soletrava.
As vozes neurais aprendem a falar ouvindo milhares de horas de pessoas reais e geram a onda sonora do zero. O salto foi medido em 2016 com o WaveNet. Nos testes do Google, as pessoas deram nota 4,1 de 5 para as vozes dele, mais de 20% acima das vozes padrão, e a distância até a fala humana caiu mais de 70%. Desde então o modelo decide onde respirar e qual palavra destacar.
Por isso, escolher uma ferramenta hoje não é mais uma questão de “soar humana”, e sim de coisas mais práticas: quanto texto ela aceita, se deixa baixar o MP3, se dá para usar comercialmente e quanto custa cada minuto.
O que olhar antes de escolher um conversor de texto em voz?
Antes de colar seu texto no primeiro site que aparecer, confira estes seis pontos. Os quatro últimos costumam ser descobertos tarde: quando o vídeo já está editado e você percebe que o áudio não pode ser baixado ou monetizado.
| Critério | O que olhar | Por que importa |
|---|---|---|
| Naturalidade | Ouça a voz lendo o SEU texto, não só a amostra do site | Uma amostra de 10 segundos é escolhida para impressionar; um parágrafo seu com números e nomes próprios mostra a verdade |
| Idiomas e sotaques | Vozes nativas do idioma, não uma voz inglesa lendo português | O sotaque estrangeiro aparece já na primeira frase |
| Limite de texto | Caracteres por áudio e por mês | Se o plano grátis corta em poucos milhares de caracteres, você precisa dividir o roteiro e juntar os áudios depois |
| Download em MP3 | Que entregue um arquivo, e não só a reprodução no navegador | Sem arquivo você não consegue montar em um vídeo nem subir em uma plataforma |
| Licença comercial | Se o plano grátis permite monetizar e se é preciso citar a ferramenta | Algumas só permitem uso comercial nos planos pagos |
| Preço por minuto | Divida o preço do plano pelos minutos de áudio que ele dá | Cada serviço chama de “crédito” uma coisa diferente: o minuto é a única medida comparável |
Quanto custa um minuto de áudio?
Comparamos por minuto de áudio, com o plano mais barato que dá para contratar em cada serviço. Onde o preço é publicado em caracteres, convertemos para minutos com a nossa média medida de 1.000 caracteres por minuto.
Olhe a última coluna. Em uma assinatura, o que você não gasta no mês costuma se perder. Em um pagamento único, fica com você.
| Serviço | Plano de entrada | Minutos | Preço por minuto | O que você não gasta |
|---|---|---|---|---|
| Voizum | Pacotes de US$ 6,99 a US$ 54,99, pagamento único | ≈ 365 – 3.723 | US$ 0,015 – US$ 0,019 (na Europa, € 0,013 – € 0,016) | Não vencem |
| MiniMax | US$ 5,00 pagamento único | ≈ 102 | US$ 0,049 | Vencem em 2 meses |
| Fish Audio | € 13,49 por mês | ≈ 200 | € 0,067 | Perdem-se todo mês |
| ElevenLabs | US$ 6,00 por mês | ≈ 30 | US$ 0,197 | Perdem-se ao cancelar |
| Narakeet | US$ 6,00 pagamento único | ≈ 30 | US$ 0,200 | Não vencem |
| TTSMaker | US$ 13,99 por mês | ≈ 305 | US$ 0,046 | Perdem-se todo mês |
Como converter texto em voz na Voizum, passo a passo
Assim você transforma um texto em áudio MP3 sem instalar nada:
- 1Entre no gerador. Cole o texto ou envie um documento (.txt, .md, .srt, .pdf, .docx). Um único áudio aceita até 600.000 caracteres, cerca de 10 horas de voz.
- 2Escolha uma voz entre as mais de 300 da biblioteca, filtrando por idioma, sotaque, gênero ou estilo. Ouça a amostra antes de decidir e, se ficar em dúvida entre duas, gere um parágrafo com cada uma.
- 3O idioma é detectado automaticamente a partir do texto, em qualquer um dos 7 disponíveis: português, inglês, espanhol, alemão, francês, italiano e russo.
- 4Ajuste a velocidade (de 0.5× a 2×), a pausa entre as frases (até 800 ms) e o volume. Dá para ouvir como os ajustes ficam antes de gerar.
- 5Clique em Gerar. Antes, você vê quantos créditos vai custar: 60 créditos a cada 1.000 caracteres (cerca de 60 por minuto de áudio), com um mínimo de 100 por áudio.
- 6Ouça o resultado e baixe o MP3. Salve no seu computador: o arquivo fica 4 dias no seu histórico.
Escreva o texto como ele soa
A voz lê o que está escrito, sinais de pontuação incluídos. A pontuação é a sua forma de dirigi-la, e o que no papel é ambíguo, como uma data ou uma sigla, pode sair de um jeito que você não esperava.
| Se você escrever | Melhor assim | Por quê |
|---|---|---|
| 02/10/2026 | 2 de outubro de 2026 | Em países diferentes a ordem de dia e mês muda: a voz não sabe qual você quer |
| 1/2 | um meio, ou metade | Pode ser lido como data, como fração ou como “um barra dois” |
| 10-15 min | de dez a quinze minutos | O hífen pode ser lido como “menos” ou ignorado |
| voizum.com/guias | voizum ponto com, barra guias | Endereços da web são lidos de forma imprevisível; ninguém digita um endereço só de ouvido |
| ONU, FIFA, CEO | ONU, FIFA, “cê-i-ô” | Siglas ditas como palavra funcionam bem; as soletradas, escreva como soam |
| Sr., Dra., pág. | senhor, doutora, página | As abreviaturas podem ser lidas letra por letra |
| (ver nota 3) | Tire do texto | O que só serve no papel também é lido em voz alta |
A pontuação é a direção
O ponto faz uma pausa e fecha a entonação; a vírgula faz uma pausa curta; o ponto de interrogação sobe o fim da frase. As reticências alongam a pausa. Se uma frase soa atropelada, quase sempre falta uma vírgula.
Para uma pausa mais longa, como entre duas seções, escreva uma marca de silêncio entre duas frases: <#1.5#> deixa um segundo e meio (até 10 segundos). Essas marcas não são lidas nem cobradas.
Frases que se entendem de ouvido
Quem ouve não pode voltar com os olhos. Uma ideia por frase e o sujeito perto do verbo. E um truque de locutor: uma frase curta depois de uma longa chama a atenção sem levantar a voz.
- Leia o texto em voz alta primeiro: onde faltar fôlego, corte a frase.
- Troque as listas com marcadores por frases: “Primeiro…, depois…, e por fim…”.
- Repita o sujeito se passaram duas frases: em áudio, “ele” ou “isso” se perdem.
Misturar idiomas
Cada áudio é gerado em um único idioma: o que predomina no texto. Uma palavra ou uma citação curta em outro idioma é lida com a voz e o sotaque do idioma principal, como faria um falante nativo. Se o seu roteiro tem parágrafos inteiros em outro idioma, gere-os à parte com uma voz desse idioma e junte depois.
Que voz escolher conforme o uso
A voz pesa mais no resultado do que qualquer ajuste. Escolha pensando em quem ouve e por quanto tempo: uma voz cheia de energia funciona em um anúncio de 30 segundos e cansa em um audiolivro de seis horas.
| Uso | Que voz procurar | Ritmo | Detalhe prático |
|---|---|---|---|
| Narração de vídeos (YouTube, documentários) | Voz de narrador, calorosa e com nuances | Normal | Teste com o gancho do início: é o que decide se alguém fica |
| Anúncios e promoções | Voz com energia, próxima | Um pouco mais rápido | Frases curtas e a chamada para ação no final, sozinha |
| Audiolivros e contos | Voz tranquila que não cansa | Normal ou um pouco mais lento | Ouça 5 minutos seguidos, não 10 segundos: o cansaço aparece com o tempo |
| Treinamento e tutoriais | Voz clara e neutra | Um pouco mais lento | Uma pausa longa após cada passo dá tempo de executá-lo |
| Notícias e resumos | Voz de locução informativa | Normal | Siglas e abreviaturas escritas como soam |
| Revisar suas próprias anotações | A que for agradável para você | Mais rápido | Ouvindo um texto que você conhece, dá para acelerar sem perder o fio |
Quanto dura um áudio conforme o texto
Em média, um minuto de áudio tem cerca de 1.000 caracteres com espaços. Mas a voz manda mais que o texto: o mesmo roteiro dura quase 50% mais com a voz mais pausada do que com a mais ágil entre as que medimos.
| Caracteres | Voz rápida | Média | Voz lenta |
|---|---|---|---|
| 1.000 (Um anúncio ou uma apresentação curta) | 47 s | 1 min 1 s | 1 min 9 s |
| 5.000 (Um artigo de blog) | 3 min 53 s | 5 min 5 s | 5 min 45 s |
| 15.000 (O roteiro de um vídeo longo do YouTube) | 11 min 38 s | 15 min 14 s | 17 min 14 s |
| 60.000 (Um capítulo longo ou um curso curto) | 46 min 31 s | 1 h 1 min | 1 h 9 min |
Formato e qualidade do áudio: MP3 e bitrate
A Voizum entrega MP3 mono a 96 kbps, que abre em qualquer player ou editor de vídeo. Uma voz ocupa um único canal e, nessa taxa, não se ouve perda na fala. Cada minuto pesa cerca de 0,72 MB; uma hora, cerca de 43 MB.
Se uma plataforma pedir mais, exportar a 192 kbps cumpre o requisito, mas o som continua sendo o do MP3 de partida.
| Destino | O que recomenda | Fonte |
|---|---|---|
| YouTube | Áudio AAC-LC ou Opus a 48 kHz; em mono, 128 kbps | Ajuda do YouTube, codificação recomendada |
| Podcast no Apple Podcasts | MP3 ou AAC de 128 a 256 kbps, volume em torno de −16 LKFS | Apple Podcasts for Creators |
| Audiolivro na Audible (ACX) | MP3 de 192 kbps ou mais, 44,1 kHz, volume entre −23 e −18 dB RMS | Requisitos da ACX |
| Ouvir no celular ou compartilhar | O MP3 como está | Sem requisito |
Direitos e uso comercial
Na Voizum, o áudio que você gera é seu para usar também com fins comerciais: vídeos monetizados, anúncios, cursos ou podcasts, sem citar a ferramenta. Há dois limites: não é permitido usá-lo para se passar por outra pessoa nem para conteúdo ilegal. Também não é permitido clonar a voz de alguém sem a permissão da pessoa.
E o que as plataformas pedem:
- O YouTube não exige avisar que a narração é de IA quando é uma voz em off ou uma dublagem. Mas exige rotular o conteúdo realista que faça parecer que uma pessoa real disse algo que não disse.
- Para monetizar, o YouTube exclui o conteúdo “não autêntico”: vídeos produzidos em massa, repetitivos ou sem contribuição própria. A voz de IA não é o problema; o que deixa um canal de fora é o roteiro copiado ou o modelo repetido mil vezes.
- A Audible, por meio da ACX, exige que os audiolivros sejam narrados por uma pessoa, exceto em seus programas autorizados de voz sintética. Se o seu destino é a Audible, confira isso antes de produzir o livro inteiro.
Texto para voz grátis: o que cada opção oferece
Para ouvir um texto uma vez, você não precisa de nenhum site. O Microsoft Edge tem uma leitura em voz alta gratuita com vozes naturais, e o sistema operacional traz seu próprio leitor. Eles leem ao vivo, só que não entregam um arquivo.
Se você precisa do MP3, entrando com a sua conta do Google você recebe 600 créditos grátis todo mês, cerca de 10 minutos de áudio, para gerar com qualquer voz da biblioteca. Eles se renovam sozinhos, não acumulam e não pedem cartão.
Se precisa de mais, os créditos são vendidos sem assinatura e não vencem. Os créditos grátis valem para gerar áudios no site; clonar a sua voz, a API e encadear áudios usam créditos comprados.
Erros comuns ao converter texto em áudio
Os que primeiro se notam ao ouvir:
- Colar o texto sem revisar: quebras de linha estranhas, números de página ou restos de formatação criam pausas onde não deveria ou são lidos em voz alta.
- Escolher a voz pela amostra de 10 segundos, sem testar com um parágrafo real do roteiro.
- Deixar siglas, abreviaturas e datas ambíguas (10/2/2026) como em um documento, em vez de como se falam.
- Frases de quatro linhas: no papel se entendem, no áudio o ouvinte perde o sujeito.
- Gerar um roteiro longo inteiro sem ouvir antes um minuto: se a voz ou a velocidade não combinarem, você paga por tudo.
- Não baixar o MP3: o arquivo é apagado do histórico depois de 4 dias.
Fontes consultadas
- Google Cloud: Cloud Text-to-Speech com a tecnologia WaveNet da DeepMind (MOS 4,1)
- Ajuda do YouTube: configurações de codificação recomendadas
- Apple Podcasts for Creators: requisitos de áudio
- ACX: requisitos de envio de áudio
- Ajuda do YouTube: divulgação de conteúdo alterado ou sintético
- Ajuda do YouTube: políticas de monetização de canais
- Microsoft: usar o modo de leitura e a leitura em voz alta no Edge
- ElevenLabs: preços
- Fish Audio: planos
- MiniMax Audio
- Narakeet: preços
- TTSMaker: preços