Voizum

Ratgeber

Text in Sprache umwandeln mit KI: Schritt für Schritt

Das Voizum-Team · Aktualisiert · 11 Min. Lesezeit

Text zu Sprache macht aus geschriebenem Text gesprochenes Audio. Vor ein paar Jahren klang das nach Telefonansage. Heutige neuronale Stimmen atmen zwischen den Sätzen und heben am Ende einer Frage die Stimme. Dieser Ratgeber zeigt, wie du das passende Tool auswählst (mit dem Minutenpreis jeweils daneben), wie du Zahlen und Abkürzungen so schreibst, dass die Stimme nicht stolpert, wie lang das Audio je nach Zeichenzahl wird und was du rechtlich damit machen darfst.

Was ist Text zu Sprache und warum klingt es nicht mehr nach Roboter?

Du nutzt es, ohne darüber nachzudenken, wenn dir das Navi sagt, du sollst am nächsten Kreisverkehr abbiegen. Text zu Sprache, englisch Text to Speech (TTS), ist jedes System, das einen Text vorliest und dir den Ton zurückgibt.

Ältere Stimmen entstanden, indem Aufnahmeschnipsel aneinandergeklebt oder der Klang nach festen Regeln berechnet wurde. Daher der monotone Ton und die Brüche zwischen den Silben: Das System verstand den Satz nicht, es buchstabierte ihn.

Neuronale Stimmen lernen sprechen, indem sie tausende Stunden echter Menschen hören, und erzeugen die Schallwelle von Grund auf. Der Sprung wurde 2016 mit WaveNet gemessen. In Googles Tests bewerteten Hörerinnen und Hörer die Stimmen mit 4,1 von 5, über 20 % besser als Standardstimmen, und der Abstand zur menschlichen Sprache schrumpfte um mehr als 70 %. Seitdem entscheidet das Modell, wo es Luft holt und welches Wort es betont.

Bei der Wahl eines Tools geht es heute also nicht mehr darum, ob es „menschlich klingt“, sondern um Handfestes: wie viel Text es verarbeitet, ob du die MP3 herunterladen kannst, ob du sie kommerziell nutzen darfst und was jede Minute kostet.

Worauf solltest du vor der Wahl eines Text-zu-Sprache-Tools achten?

Bevor du deinen Text in die erstbeste Website kopierst, prüfe diese sechs Punkte. Die letzten vier merkt man oft zu spät: wenn das Video schon geschnitten ist und sich zeigt, dass das Audio nicht heruntergeladen oder nicht monetarisiert werden darf.

KriteriumWorauf du achtestWarum es wichtig ist
NatürlichkeitHör dir die Stimme mit DEINEM Text an, nicht nur mit der Demo der WebsiteEine 10-Sekunden-Demo ist so gewählt, dass sie gut klingt; ein Absatz von dir mit Zahlen und Eigennamen zeigt die Wahrheit
Sprachen und AkzenteMuttersprachliche Stimmen für die Sprache, keine englische Stimme, die Deutsch liestDer fremde Akzent verrät sich im ersten Satz
TextlimitZeichen pro Audio und pro MonatWenn der Gratis-Plan nach wenigen tausend Zeichen abbricht, musst du das Skript teilen und die Audios wieder zusammenfügen
MP3-DownloadDu bekommst eine Datei, nicht nur die Wiedergabe im BrowserOhne Datei kannst du sie weder in ein Video einbauen noch auf einer Plattform hochladen
Kommerzielle LizenzOb der Gratis-Plan Monetarisierung erlaubt und ob du das Tool nennen musstManche erlauben die kommerzielle Nutzung nur in bezahlten Plänen
Preis pro MinuteTeile den Planpreis durch die Audiominuten, die er liefertJeder Anbieter versteht unter „Credit“ etwas anderes: Die Minute ist der einzige vergleichbare Maßstab

Was kostet eine Minute Audio?

Wir vergleichen pro Audiominute, jeweils mit dem günstigsten Plan, den du bei dem Anbieter buchen kannst. Wo der Preis in Zeichen angegeben ist, rechnen wir mit unserem gemessenen Durchschnitt von 1.000 Zeichen pro Minute in Minuten um.

Schau auf die letzte Spalte. Bei einem Abo verfällt, was du im Monat nicht verbrauchst, meistens. Bei einer Einmalzahlung bleibt es erhalten.

AnbieterEinstiegsplanMinutenPreis pro MinuteWas du nicht verbrauchst
VoizumPakete von 5,99 € bis 47,99 €, einmalig≈ 365 – 3.7230,013 € – 0,016 € (außerhalb Europas, 0,015 $ – 0,019 $)Verfallen nie
MiniMax5,00 $ einmalig≈ 1020,049 $Verfallen nach 2 Monaten
Fish Audio13,49 € pro Monat≈ 2000,067 €Verfallen jeden Monat
ElevenLabs6,00 $ pro Monat≈ 300,197 $Verfallen bei Kündigung
Narakeet6,00 $ einmalig≈ 300,200 $Verfallen nie
TTSMaker13,99 $ pro Monat≈ 3050,046 $Verfallen jeden Monat
Preise von den offiziellen Websites der jeweiligen Marke, Einstiegsplan bei monatlicher Zahlung (nie der auf Monate heruntergerechnete Jahrespreis) und in der Währung, in der sie veröffentlicht sind, abgerufen im September und Oktober 2026. Preise ändern sich: Prüfe sie vor dem Kauf.

So wandelst du Text bei Voizum in Sprache um, Schritt für Schritt

So machst du aus einem Text ein MP3-Audio, ohne etwas zu installieren:

  1. 1Öffne den Generator. Füge den Text ein oder lade ein Dokument hoch (.txt, .md, .srt, .pdf, .docx). Ein einzelnes Audio fasst bis zu 600.000 Zeichen, etwa 10 Stunden Sprache.
  2. 2Wähle eine der über 300 Stimmen der Stimmbibliothek und filtere nach Sprache, Akzent, Geschlecht oder Stil. Hör dir vorher die Sprachprobe an, und wenn du zwischen zwei Stimmen schwankst, erstelle mit jeder einen Absatz.
  3. 3Die Sprache wird automatisch aus dem Text erkannt, in einer der 7 verfügbaren: Deutsch, Englisch, Spanisch, Französisch, Portugiesisch, Italienisch und Russisch.
  4. 4Stelle die Geschwindigkeit (von 0.5× bis 2×), die Pause zwischen den Sätzen (bis zu 800 ms) und die Lautstärke ein. Du kannst dir die Einstellungen vor dem Erstellen anhören.
  5. 5Klicke auf „Erstellen“. Vorher siehst du, wie viele Credits es kostet: 60 Credits pro 1.000 Zeichen (etwa 60 pro Audiominute), mindestens 100 pro Audio.
  6. 6Höre dir das Ergebnis an und lade die MP3 herunter. Speichere sie auf deinem Rechner: Die Datei bleibt 4 Tage in deinem Verlauf.

Schreibe den Text so, wie er klingt

Die Stimme liest, was dasteht, samt Satzzeichen. Die Zeichensetzung ist deine Regie, und was auf Papier mehrdeutig ist, etwa ein Datum oder eine Abkürzung, kann anders klingen als gedacht.

Wenn du schreibstBesser soWarum
02.10.20262. Oktober 2026In anderen Ländern steht der Monat vor dem Tag: Die Stimme weiß nicht, welche Reihenfolge du meinst
1/2die HälfteKann als Datum, als Bruch oder als „eins Schrägstrich zwei“ gelesen werden
10-15 Min.zehn bis fünfzehn MinutenDer Strich wird als „minus“ gelesen oder übersprungen
voizum.com/ratgebervoizum Punkt com Schrägstrich RatgeberWebadressen werden unvorhersehbar gelesen; niemand tippt eine Adresse nach, die er nur gehört hat
NATO, UNO, BMWNATO, UNO, „Be-Em-Weh“Abkürzungen, die man als Wort spricht, klappen gut; die buchstabierten schreibst du so, wie sie klingen
Hr., Dr., S., z. B.Herr, Doktor, Seite, zum BeispielAbkürzungen werden manchmal Buchstabe für Buchstabe gelesen
(siehe Anm. 3)Streich es aus dem TextWas nur auf Papier funktioniert, wird trotzdem vorgelesen

Zeichensetzung ist die Regieanweisung

Ein Punkt macht eine Pause und schließt die Betonung ab; ein Komma, eine kurze Pause; ein Fragezeichen hebt das Satzende an. Auslassungspunkte dehnen die Pause. Wenn ein Satz gehetzt klingt, fehlt fast immer ein Komma.

Für eine längere Pause, etwa zwischen zwei Abschnitten, schreibst du eine Stille-Marke zwischen zwei Sätze: <#1.5#> lässt anderthalb Sekunden Pause (bis zu 10 Sekunden). Diese Marken werden weder gelesen noch berechnet.

Sätze, die man beim Hören versteht

Wer zuhört, kann nicht mit den Augen zurückspringen. Ein Gedanke pro Satz, das Subjekt nah beim Verb. Und ein Sprechertrick: Ein kurzer Satz nach einem langen lenkt die Aufmerksamkeit, ohne dass du lauter wirst.

  • Lies den Text zuerst selbst laut: Wo dir die Luft ausgeht, teile den Satz.
  • Ersetze Aufzählungen mit Spiegelstrichen durch Sätze: „Erstens …, danach … und zuletzt …“.
  • Wiederhole das Subjekt, wenn zwei Sätze vergangen sind: Im Audio gehen „er“ oder „das“ verloren.

Sprachen mischen

Jedes Audio wird in einer einzigen Sprache erzeugt: der, die im Text überwiegt. Ein Wort oder ein kurzes Zitat in einer anderen Sprache wird mit Stimme und Akzent der Hauptsprache gelesen, so wie es ein Muttersprachler tun würde. Wenn dein Skript ganze Absätze in einer anderen Sprache enthält, erstelle sie getrennt mit einer Stimme dieser Sprache und füge sie danach zusammen.

Welche Stimme für welchen Zweck?

Die Stimme prägt das Ergebnis mehr als jede Einstellung. Wähle danach, wer zuhört und wie lange: Eine energiegeladene Stimme funktioniert in einem 30-Sekunden-Spot und ermüdet in einem Hörbuch von sechs Stunden.

EinsatzWelche StimmeTempoPraxistipp
Videovertonung (YouTube, Dokus)Erzählerstimme, warm und mit NuancenNormalTeste sie mit deinem Einstiegssatz: Der entscheidet, ob jemand dranbleibt
Werbung und PromosStimme mit Energie, nahbarEtwas schnellerKurze Sätze und der Handlungsaufruf am Ende, allein
Hörbücher und GeschichtenRuhige Stimme, die nicht ermüdetNormal oder etwas langsamerHör 5 Minuten am Stück, nicht 10 Sekunden: Die Ermüdung zeigt sich erst mit der Zeit
Schulungen und TutorialsKlare, neutrale StimmeEtwas langsamerEine lange Pause nach jedem Schritt lässt Zeit, ihn auszuführen
Nachrichten und ZusammenfassungenStimme im NachrichtenstilNormalAbkürzungen und Kürzel so schreiben, wie sie klingen
Eigene Notizen durchgehenDie, die dir angenehm istSchnellerBei einem Text, den du kennst, kannst du das Tempo erhöhen, ohne den Faden zu verlieren

Wie lang wird ein Audio je nach Text?

Im Durchschnitt sind eine Audiominute etwa 1.000 Zeichen inklusive Leerzeichen. Aber die Stimme bestimmt mehr als der Text: Dasselbe Skript dauert mit der gemächlichsten Stimme fast 50 % länger als mit der flottesten, die wir gemessen haben.

ZeichenSchnelle StimmeDurchschnittLangsame Stimme
1.000 (Eine Anzeige oder eine kurze Präsentation)47 s1 min 1 s1 min 9 s
5.000 (Ein Blogartikel)3 min 53 s5 min 5 s5 min 45 s
15.000 (Das Skript eines langen YouTube-Videos)11 min 38 s15 min 14 s17 min 14 s
60.000 (Ein langes Kapitel oder ein kurzer Kurs)46 min 31 s1 h 1 min1 h 9 min
Gemessene Tempi an echten Audios: 14,5 bis 21,5 Zeichen pro Sekunde je nach Stimme. Bei Geschwindigkeit 1×.

Audioformat und Qualität: MP3 und Bitrate

Voizum liefert MP3 mono mit 96 kbit/s, das sich in jedem Player und Videoeditor öffnen lässt. Eine Stimme braucht nur einen Kanal, und bei dieser Bitrate hört man bei Sprache keinen Verlust. Jede Minute wiegt etwa 0,72 MB, eine Stunde etwa 43 MB.

Wenn eine Plattform mehr verlangt, erfüllt ein Export mit 192 kbit/s die Vorgabe, aber der Klang bleibt der der ursprünglichen MP3.

ZielWas empfohlen wirdQuelle
YouTubeAudio AAC-LC oder Opus mit 48 kHz; bei Mono 128 kbit/sYouTube-Hilfe, empfohlene Kodierung
Podcast bei Apple PodcastsMP3 oder AAC mit 128 bis 256 kbit/s, Lautheit um −16 LKFSApple Podcasts for Creators
Hörbuch bei Audible (ACX)MP3 mit 192 kbit/s oder mehr, 44,1 kHz, Pegel zwischen −23 und −18 dB RMSACX-Anforderungen
Auf dem Handy anhören oder teilenDie MP3 so, wie sie istKeine Vorgabe

Rechte und kommerzielle Nutzung

Bei Voizum gehört das Audio, das du erstellst, dir, auch für kommerzielle Zwecke: monetarisierte Videos, Werbung, Kurse oder Podcasts, ohne das Tool nennen zu müssen. Es gibt zwei Grenzen: Du darfst es nicht nutzen, um dich als jemand anderes auszugeben, und nicht für illegale Inhalte. Außerdem darfst du die Stimme einer anderen Person nicht ohne deren Erlaubnis klonen.

Und das verlangen die Plattformen:

  • YouTube verlangt keinen Hinweis darauf, dass die Erzählung von einer KI stammt, wenn es ein Voiceover oder eine Synchronisation ist. Realistische Inhalte, die den Eindruck erwecken, eine echte Person habe etwas gesagt, was sie nicht gesagt hat, müssen aber gekennzeichnet werden.
  • Zur Monetarisierung schließt YouTube „nicht authentische“ Inhalte aus: massenhaft produzierte, repetitive Videos ohne eigenen Beitrag. Die KI-Stimme ist dabei egal; was einen Kanal ausschließt, ist das kopierte Skript oder die tausendfach wiederholte Vorlage.
  • Audible verlangt über ACX, dass Hörbücher von einem Menschen gesprochen werden, außer in den eigenen zugelassenen Programmen für synthetische Stimmen. Wenn dein Ziel Audible ist, kläre das, bevor du das ganze Buch produzierst.

Text zu Sprache kostenlos: was jede Option bietet

Um einen Text einmal anzuhören, brauchst du keine Website. Microsoft Edge hat eine kostenlose Vorlesefunktion mit natürlichen Stimmen, und das Betriebssystem bringt einen eigenen Vorleser mit. Sie lesen allerdings live vor und liefern keine Datei.

Wenn du die MP3 brauchst, bekommst du mit deinem Google-Konto jeden Monat 600 Gratis-Credits, etwa 10 Minuten Audio, die du mit jeder Stimme der Stimmbibliothek nutzen kannst. Sie erneuern sich von selbst, werden nicht angesammelt und brauchen keine Karte.

Wenn du mehr brauchst, kaufst du Credits ohne Abo, und sie verfallen nicht. Die Gratis-Credits gelten für Audios auf der Website; Stimmklonen, die API und das Verketten von Audios nutzen gekaufte Credits.

Häufige Fehler beim Umwandeln von Text in Audio

Die, die man beim Anhören zuerst bemerkt:

  • Den Text ungeprüft einfügen: seltsame Zeilenumbrüche, Seitenzahlen oder Formatierungsreste erzeugen Pausen an falscher Stelle oder werden mitgelesen.
  • Die Stimme nach der 10-Sekunden-Demo wählen, ohne sie mit einem echten Absatz aus dem Skript zu testen.
  • Abkürzungen, Kürzel und mehrdeutige Datumsangaben (10.2.2026) so lassen, wie sie im Dokument stehen, statt so, wie man sie spricht.
  • Sätze über vier Zeilen: Auf Papier versteht man sie, im Audio verliert der Hörer das Subjekt.
  • Ein langes Skript komplett erstellen, ohne vorher eine Minute anzuhören: Wenn Stimme oder Tempo nicht passen, zahlst du für alles.
  • Die MP3 nicht herunterladen: Die Datei wird nach 4 Tagen aus dem Verlauf gelöscht.

Verwendete Quellen

  1. Google Cloud: Cloud Text-to-Speech mit DeepMinds WaveNet-Technologie (MOS 4,1)
  2. YouTube-Hilfe: empfohlene Kodierungseinstellungen
  3. Apple Podcasts for Creators: Audioanforderungen
  4. ACX: Anforderungen an die Audioabgabe
  5. YouTube-Hilfe: Offenlegung von veränderten oder synthetischen Inhalten
  6. YouTube-Hilfe: Richtlinien zur Kanalmonetarisierung
  7. Microsoft: Lesemodus in Microsoft Edge verwenden
  8. ElevenLabs: Preise
  9. Fish Audio: Pläne
  10. MiniMax Audio
  11. Narakeet: Preise
  12. TTSMaker: Preise

Das könnte dir auch helfen

Häufige Fragen

Gibt es Text zu Sprache kostenlos und ohne Limit?
Nur, wenn du keine Datei brauchst: Die Vorleser von Browser und Betriebssystem sind kostenlos und unbegrenzt, speichern aber kein Audio. Websites, die MP3 gratis erstellen, begrenzen meist die Zeichen pro Audio oder pro Monat. Bei Voizum bekommst du mit deinem Google-Konto jeden Monat 600 Gratis-Credits, etwa 10 Minuten Audio.
Wie lade ich den Text als MP3 herunter?
Erstelle das Audio, höre es an und klicke auf „Herunterladen“: Du bekommst eine MP3, die sich in jedem Player oder Videoeditor öffnen lässt. Speichere sie auf deinem Rechner, denn die Datei bleibt 4 Tage im Verlauf.
Kann ich eine männliche oder weibliche Stimme wählen?
Ja. Die Stimmbibliothek hat über 300 Stimmen, die du nach Geschlecht, Sprache, Akzent und Stil (Erzähler, Werbung, Nachrichten) filtern kannst. Höre dir die Sprachprobe jeder Stimme an, bevor du erstellst.
Wie viel Text kann ich auf einmal umwandeln?
Bis zu 600.000 Zeichen pro Audio, etwa 10 Stunden Sprache. Zum Vergleich: Das Skript eines 15-Minuten-Videos hat rund 15.000 Zeichen.
Darf ich das Audio auf YouTube nutzen und monetarisieren?
Ja, die kommerzielle Nutzung ist erlaubt. YouTube verlangt keinen Hinweis auf ein KI-Voiceover, monetarisiert aber keine Massenware oder Inhalte ohne eigenen Beitrag. Entscheidend ist also, dass dein Video etwas Eigenes bietet.
Hört man, dass es eine KI-Stimme ist?
In den meisten Sätzen nicht, wenn der Text fürs Ohr geschrieben ist. Verraten wird sie bei Abkürzungen, Kürzeln und Eigennamen, die wie in einem Dokument geschrieben sind.
Kann ich Text mit meiner eigenen Stimme in Sprache umwandeln?
Ja: Du klonst deine Stimme mit einer Aufnahme von 15 bis 60 Sekunden und nutzt sie wie jede andere. Das Klonen kostet 199 Credits und setzt voraus, dass du schon einmal Credits gekauft hast.
In welchen Sprachen funktioniert es?
In Deutsch, Englisch, Spanisch, Französisch, Portugiesisch, Italienisch und Russisch, mit muttersprachlichen Stimmen und mehreren Akzenten (zum Beispiel amerikanisches und britisches Englisch, europäisches und lateinamerikanisches Spanisch). Die Sprache wird automatisch aus dem Text erkannt.

Weitere Ratgeber

Gib deinen Text ein und hör ihn mit einer echten Stimme

Wenn du dich mit Google anmeldest, schenken wir dir jeden Monat 600 Credits: etwa 10 Minuten Audio.