Ratgeber
KI-Sprecher: Erzählerstimme für Hörbücher und Videos
Das Voizum-Team · Aktualisiert · 9 Min. Lesezeit
Ein KI-Sprecher liest dein Skript vor und gibt dir eine MP3 zurück. Ob das nach Erzähler oder nach Vorlesefunktion klingt, hängt von der Stimme ab, die du wählst, davon, wie du das Skript schreibst, und vom Tempo, das du einstellst. Unten steht, was eine Doku, eine Geschichte, ein Hörbuch oder ein Erklärvideo braucht, wie du Pausen im Text markierst und wie du alles Schritt für Schritt in Voizum umsetzt.
Was ist ein KI-Sprecher und was lässt ihn professionell klingen?
Du fügst das Skript ein, wählst eine Stimme und lädst die Audiodatei herunter. Das ist ein KI-Sprecher für Texte. Heutige Stimmen atmen, heben bei Fragen die Stimme und machen an Punkten Pause, deshalb ist die roboterhafte Vorlesestimme von vor ein paar Jahren nicht mehr der Maßstab.
Was eine „Maschinenstimme“ von einem Erzähler trennt, sind drei Entscheidungen, die du triffst, bevor du auf „Erstellen“ klickst:
- Die Stimme: tief und ruhig für eine Doku, warm für eine Geschichte, klar für eine Lektion.
- Der Text: kurze Sätze mit je einem Gedanken und knifflige Zahlen so geschrieben, wie du sie hören willst.
- Das Tempo: wie schnell die Stimme spricht, der Abstand zwischen den Sätzen und längere Pausen dort, wo die Geschichte sie braucht.
Welche Erzählerstimme passt zu welcher Art von Erzählung?
Lies eine Gruselgeschichte mit Werbestimme vor, und die Spannung ist weg. Leg eine Märchenstimme auf ein Software-Tutorial, und es klingt wie ein Witz. Entscheide deshalb zuerst, was du vertonst:
| Art der Erzählung | Stimme | Tempo | Tipp |
|---|---|---|---|
| Dokumentarfilm | Tief und ruhig | Gemächlich | Stille zwischen den Abschnitten, damit das Bild wirken kann |
| Kindergeschichte | Warm und ausdrucksvoll | Langsam | Kurze Sätze und eine Pause vor der Überraschung |
| Hörbuch | Natürlich, auch nach Stunden angenehm | Mittel und gleichmäßig | Dieselbe Stimme und dieselben Einstellungen in jedem Kapitel |
| Erklärvideo und E-Learning | Klar und neutral | Mittel | Ein Schritt pro Satz und eine Pause nach jedem Begriff |
| Krimi oder Horror | Tief und zurückhaltend | Langsam, mit langen Pausen | Die Pause vor der Wendung ist gruseliger als die Wendung selbst |
| Werbung | Energisch, mit Lächeln | Flott | Wenig Text und die Marke am Ende |
Erzählerstimme für Dokus
Die Stimme einer Doku begleitet das Bild und konkurriert nicht mit ihm. Such dir eine tiefe oder mittlere Stimme ohne viel Schnörkel und nimm das Tempo etwas zurück. Was wirklich nach Fernsehen klingt, sind die Pausen: ein bis zwei Sekunden zwischen den Abschnitten, in denen nur das Bild spricht.
„Auf 4.000 Metern Höhe enthält die Luft nur halb so viel Sauerstoff.“ So schreibt man eine Doku: im Präsens und mit der Information vorne. Versteckst du sie am Ende eines Nebensatzes, hat der Zuhörer schon abgeschaltet, wenn sie kommt.
Wie vertont man eine Geschichte?
Warm und ohne Eile. Wähle eine nahbare Stimme, stell sie etwas langsamer als normal ein und vergrößere den Abstand zwischen den Sätzen. Bei einer Gutenachtgeschichte bringt ein langsameres Tempo mehr als jeder Soundeffekt.
Wenn Figuren sprechen, gibt der Dialogmodus jeder eine eigene Stimme (mehr dazu weiter unten). Nimm allgemeine oder eigene Figuren und eigene oder gemeinfreie Geschichten.
Hörbuch
Eine sehr markante Stimme gefällt in der ersten Minute und ermüdet in der ersten Stunde. Deshalb wählst du die Stimme für ein Hörbuch mit einer ganzen Buchseite und hörst mindestens fünf Minuten zu, nie mit einem einzelnen Testsatz.
Leg Tempo, Satzabstand und Lautstärke fest und ändere sie zwischen den Kapiteln nicht mehr. Wenn Kapitel 4 schneller läuft als Kapitel 3, fällt das den Hörern sofort auf.
Erklärvideos und E-Learning
Hier arbeitet die Stimme für den Bildschirm. Klar, in normalem Tempo und mit einer Pause nach jedem Begriff, damit man Zeit zum Hinschauen hat. Wenn dein Kurs mehrere Module hat, wechsle die Stimme nicht: Sie wird zur Stimme deines Kurses.
Krimi, Horror und Erzählungen
Angst lebt von der Stille. Eine Stimme im Stil Dramatisch oder eine tiefe, zurückhaltende, langsamer, und eine lange Pause direkt vor dem entscheidenden Satz: „Er öffnete die Tür. <#2#> Niemand war da.“ Zwei Sekunden Nichts wiegen mehr als ein Adjektiv.
Werbespots
Ein Radio- oder Social-Media-Spot dauert Sekunden. Energische Stimme, Tempo etwas über normal und kleine Abstände zwischen den Sätzen. Schreib weniger, als du für möglich hältst, und schließ mit der Marke und dem, was der Hörer tun soll.
So schreibst du ein Skript zum Vorlesen
Hörer können nicht zurückblättern. Jeder Satz muss beim ersten Mal sitzen, egal ob ein Mensch oder eine KI spricht:
- Wenn du mitten im Satz Luft holen müsstest, teile ihn in zwei. Ein Punkt ist eine Pause, ein Komma eine halbe.
- Ein Gedanke pro Satz, mit dem wichtigen Wort am Ende, wo die Betonung hinfällt.
- Frage- und Ausrufezeichen verändern die Betonung, Auslassungspunkte verlängern die Pause. Setz sie mit Absicht.
- Gewöhnliche Beträge, Datumsangaben und Uhrzeiten werden gut gelesen. Alles, was man auf zwei Arten sagen kann, wie „1/2“, „3x“ oder eine Abkürzung, die man nicht buchstabiert, schreibst du so aus, wie du es hören willst.
- Streich lange Klammern, Fußnoten, Links und Listen mit mehr als vier Punkten. Laut gelesen gehen sie unter.
- Lies das Skript vor dem Erstellen selbst laut. Wo du stolperst, verliert sich auch der Hörer.
Eigene Pausen mit <#1.5#>
Für eine Stille, die länger ist als ein Punkt, schreibst du zwischen zwei Sätze eine Marke mit den Sekunden: <#1.5#> lässt anderthalb Sekunden, <#3#> drei, bis zu 10 pro Marke. Das hilft, in einer Geschichte die Szene zu wechseln, in einer Doku eine Einstellung wirken zu lassen oder in einer Erzählung Spannung aufzubauen.
Die Marke wird weder vorgelesen noch berechnet: Es zählen nur die Zeichen, die gesprochen werden.
In jener Nacht erlosch der Leuchtturm zum ersten Mal seit hundert Jahren. <#2#>
Niemand im Dorf konnte erklären, warum. <#1#>
Niemand, außer dem Leuchtturmwärter.So stellst du das Tempo der Erzählerstimme ein
Der Generator hat zwei Regler. Das Tempo, von 0.5× bis 2×, bestimmt, wie schnell die Stimme spricht. Der Abstand zwischen den Sätzen, von „Fließend“ bis „Mit Pausen“ (bis zu 800 ms), bestimmt, wie viel Stille zwischen einem Satz und dem nächsten bleibt. Vor dem Erstellen kannst du die Stimme mit diesen Einstellungen anhören und sie für das nächste Mal in der Stimme speichern.
Zum Einstieg: Doku und Hörbuch in normalem Tempo oder etwas darunter, Geschichten und Horror langsamer und mit mehr Abstand, Werbung etwas schneller und mit weniger. Feinabstimmung am besten mit einem echten Absatz aus deinem Skript.
Als menschlicher Richtwert: Das National Center for Voice and Speech beziffert die durchschnittliche Unterhaltung im amerikanischen Englisch auf etwa 150 Wörter pro Minute. Eine Erzählung läuft meist etwas langsamer als ein schnelles Gespräch.
Deine Erzählung in Voizum, Schritt für Schritt
Mit fertigem Skript:
- 1Öffne die Stimmbibliothek und filtere nach Sprache und Stil. Fang mit „Erzählung“ an; für eine Doku probier auch „Informativ“, für Horror „Dramatisch“.
- 2Hör dir die Sprachprobe von drei oder vier Stimmen an und nimm die, die zur Tabelle oben passt. Es gibt über 300 Stimmen in 7 Sprachen: Deutsch, Englisch, Spanisch, Französisch, Portugiesisch, Italienisch und Russisch.
- 3Füge im Generator das Skript ein oder klick auf „Dokument hochladen“ (akzeptiert .txt, .md, .srt, .pdf, .docx). Die Sprache wird automatisch erkannt.
- 4Setz die Marken <#1.5#> dorthin, wo du eine lange Pause willst.
- 5Stell Tempo und Satzabstand ein und hör die Stimme damit an, bevor du erstellst. Wenn sie dir gefallen, speichere sie mit „Für diese Stimme speichern“.
- 6Klick auf „Erstellen“. Bevor etwas abgebucht wird, siehst du, wie viele Credits es kostet.
- 7Hör dir das Ergebnis an und lade die MP3 für deinen Videoeditor oder deinen Podcast herunter.
Kann ich mit meiner eigenen Stimme erzählen?
Ja, und wenn du einen Kanal, einen Kurs oder einen Podcast hast, ist das wahrscheinlich die beste Option. Aus einer Aufnahme von 15 bis 60 Sekunden erstellt Voizum eine Kopie deiner Stimme. Ab dann schreibst du das Skript, und deine Stimme liest es vor, ohne dass du noch einmal aufnehmen musst.
Nimm die Sprachprobe so auf, wie die Erzählung klingen soll. Wenn du hastig und im Ton eines Handyvideos aufnimmst, erzählt der Klon genauso. Klonen kostet 199 Credits und wird mit deinem ersten Credit-Kauf freigeschaltet.
Um in einer anderen Sprache zu erzählen, kopiert der Modus ohne Akzent nur das Timbre deiner Stimme. Und wenn du auf YouTube veröffentlichst: Laut deren Hilfeseite braucht das Klonen deiner eigenen Stimme für Voiceovers oder Synchronisationen nicht das Label für veränderte oder synthetische Inhalte.
Geschichten mit Figuren und der Dialogmodus
Im Dialogmodus markierst du am Anfang jeder Zeile, wer spricht, und alles kommt in einer einzigen Audiodatei heraus, mit bis zu 5 Figuren und 100 Sprechbeiträgen. Das Skript fügst du am Stück ein:
So schreibst du das Skript
Der Name steht in eckigen Klammern, in <> oder mit einem Doppelpunkt dahinter. Was du darunter ohne Namen schreibst, gehört weiter zu dieser Figur, ein langer Absatz braucht die Marke also nicht zu wiederholen. Danach weist du Stimmen zu: eine ruhige für den Erzähler und für die Figuren Stimmen, die sich gut voneinander unterscheiden.
[Erzähler] Der Fuchs hatte drei Tage nichts gefressen, als er den Raben auf dem Ast sah.
[Fuchs] Was für glänzende Federn! Deine Stimme ist bestimmt noch schöner.
[Rabe] Meinst du wirklich?
[Erzähler] Und der Rabe öffnete stolz den Schnabel.Einstellungen, die helfen
Lass „Stimmen untereinander angleichen“ eingeschaltet, sonst klingt es nach zusammengeklebten Aufnahmen. Der Ausdruck reicht von „Zurückhaltend“ bis „Lebhaft“: Dreh ihn bei einer Kindergeschichte etwas hoch und lass ihn bei einem ernsten Text in der Mitte.
Hörbücher und lange Erzählungen
Eine einzelne Audiodatei fasst bis zu 600.000 Zeichen, etwa 10 Stunden Sprache, ein kurzes Buch passt also komplett hinein. Trotzdem ist bei einem Hörbuch eine Datei pro Kapitel besser: Die Hörer springen zwischen den Kapiteln, und du kannst Kapitel 7 ändern, ohne die anderen anzufassen.
Mit „Audios verketten“ erstellst du bis zu 100 Audios auf einmal, jedes mit eigenem Namen und mit nur einem einzigen Mindestbetrag für den ganzen Stapel. Wie das Klonen wird es mit deinem ersten Credit-Kauf freigeschaltet.
Bevor du ein KI-erzähltes Hörbuch veröffentlichst, schau dir die Regeln des Shops an, denn sie unterscheiden sich stark:
- ACX (die Produktionsplattform von Audible) verlangt, dass Hörbücher von einem Menschen gesprochen werden, außer es gibt eine Genehmigung, und verbietet Text-to-Speech oder KI ohne sie.
- Google Play Books hat ein eigenes Programm für Hörbücher mit automatischer Erzählung, vorausgesetzt, du besitzt die Audiorechte am Buch.
- Vertone nur Texte, die du selbst geschrieben hast, für die du die Rechte hast oder die gemeinfrei sind.
Was es kostet
Wenn du dich mit deinem Google-Konto anmeldest, bekommst du jeden Monat 600 Gratis-Credits, etwa 10 Minuten Erzählung, genug, um mehrere Stimmen mit deinem eigenen Skript zu testen. Sie erneuern sich von selbst, gelten für den Generator und den Dialogmodus, und es wird keine Karte verlangt.
Danach kosten je 1.000 Zeichen 60 Credits, etwa 60 pro Audiominute. Es gibt kein Abo, und gekaufte Credits verfallen nicht.