Voizum

Ratgeber

KI-Sprecher: Erzählerstimme für Hörbücher und Videos

Das Voizum-Team · Aktualisiert · 9 Min. Lesezeit

Ein KI-Sprecher liest dein Skript vor und gibt dir eine MP3 zurück. Ob das nach Erzähler oder nach Vorlesefunktion klingt, hängt von der Stimme ab, die du wählst, davon, wie du das Skript schreibst, und vom Tempo, das du einstellst. Unten steht, was eine Doku, eine Geschichte, ein Hörbuch oder ein Erklärvideo braucht, wie du Pausen im Text markierst und wie du alles Schritt für Schritt in Voizum umsetzt.

Was ist ein KI-Sprecher und was lässt ihn professionell klingen?

Du fügst das Skript ein, wählst eine Stimme und lädst die Audiodatei herunter. Das ist ein KI-Sprecher für Texte. Heutige Stimmen atmen, heben bei Fragen die Stimme und machen an Punkten Pause, deshalb ist die roboterhafte Vorlesestimme von vor ein paar Jahren nicht mehr der Maßstab.

Was eine „Maschinenstimme“ von einem Erzähler trennt, sind drei Entscheidungen, die du triffst, bevor du auf „Erstellen“ klickst:

  • Die Stimme: tief und ruhig für eine Doku, warm für eine Geschichte, klar für eine Lektion.
  • Der Text: kurze Sätze mit je einem Gedanken und knifflige Zahlen so geschrieben, wie du sie hören willst.
  • Das Tempo: wie schnell die Stimme spricht, der Abstand zwischen den Sätzen und längere Pausen dort, wo die Geschichte sie braucht.

Welche Erzählerstimme passt zu welcher Art von Erzählung?

Lies eine Gruselgeschichte mit Werbestimme vor, und die Spannung ist weg. Leg eine Märchenstimme auf ein Software-Tutorial, und es klingt wie ein Witz. Entscheide deshalb zuerst, was du vertonst:

Art der ErzählungStimmeTempoTipp
DokumentarfilmTief und ruhigGemächlichStille zwischen den Abschnitten, damit das Bild wirken kann
KindergeschichteWarm und ausdrucksvollLangsamKurze Sätze und eine Pause vor der Überraschung
HörbuchNatürlich, auch nach Stunden angenehmMittel und gleichmäßigDieselbe Stimme und dieselben Einstellungen in jedem Kapitel
Erklärvideo und E-LearningKlar und neutralMittelEin Schritt pro Satz und eine Pause nach jedem Begriff
Krimi oder HorrorTief und zurückhaltendLangsam, mit langen PausenDie Pause vor der Wendung ist gruseliger als die Wendung selbst
WerbungEnergisch, mit LächelnFlottWenig Text und die Marke am Ende
Die Stimmbibliothek lässt sich nach Sprache und Akzent, Geschlecht, Alter und Stil filtern: Erzählung, Informativ, Dramatisch, Werbung oder Gesprächig.

Erzählerstimme für Dokus

Die Stimme einer Doku begleitet das Bild und konkurriert nicht mit ihm. Such dir eine tiefe oder mittlere Stimme ohne viel Schnörkel und nimm das Tempo etwas zurück. Was wirklich nach Fernsehen klingt, sind die Pausen: ein bis zwei Sekunden zwischen den Abschnitten, in denen nur das Bild spricht.

„Auf 4.000 Metern Höhe enthält die Luft nur halb so viel Sauerstoff.“ So schreibt man eine Doku: im Präsens und mit der Information vorne. Versteckst du sie am Ende eines Nebensatzes, hat der Zuhörer schon abgeschaltet, wenn sie kommt.

Wie vertont man eine Geschichte?

Warm und ohne Eile. Wähle eine nahbare Stimme, stell sie etwas langsamer als normal ein und vergrößere den Abstand zwischen den Sätzen. Bei einer Gutenachtgeschichte bringt ein langsameres Tempo mehr als jeder Soundeffekt.

Wenn Figuren sprechen, gibt der Dialogmodus jeder eine eigene Stimme (mehr dazu weiter unten). Nimm allgemeine oder eigene Figuren und eigene oder gemeinfreie Geschichten.

Hörbuch

Eine sehr markante Stimme gefällt in der ersten Minute und ermüdet in der ersten Stunde. Deshalb wählst du die Stimme für ein Hörbuch mit einer ganzen Buchseite und hörst mindestens fünf Minuten zu, nie mit einem einzelnen Testsatz.

Leg Tempo, Satzabstand und Lautstärke fest und ändere sie zwischen den Kapiteln nicht mehr. Wenn Kapitel 4 schneller läuft als Kapitel 3, fällt das den Hörern sofort auf.

Erklärvideos und E-Learning

Hier arbeitet die Stimme für den Bildschirm. Klar, in normalem Tempo und mit einer Pause nach jedem Begriff, damit man Zeit zum Hinschauen hat. Wenn dein Kurs mehrere Module hat, wechsle die Stimme nicht: Sie wird zur Stimme deines Kurses.

Krimi, Horror und Erzählungen

Angst lebt von der Stille. Eine Stimme im Stil Dramatisch oder eine tiefe, zurückhaltende, langsamer, und eine lange Pause direkt vor dem entscheidenden Satz: „Er öffnete die Tür. <#2#> Niemand war da.“ Zwei Sekunden Nichts wiegen mehr als ein Adjektiv.

Werbespots

Ein Radio- oder Social-Media-Spot dauert Sekunden. Energische Stimme, Tempo etwas über normal und kleine Abstände zwischen den Sätzen. Schreib weniger, als du für möglich hältst, und schließ mit der Marke und dem, was der Hörer tun soll.

So schreibst du ein Skript zum Vorlesen

Hörer können nicht zurückblättern. Jeder Satz muss beim ersten Mal sitzen, egal ob ein Mensch oder eine KI spricht:

  • Wenn du mitten im Satz Luft holen müsstest, teile ihn in zwei. Ein Punkt ist eine Pause, ein Komma eine halbe.
  • Ein Gedanke pro Satz, mit dem wichtigen Wort am Ende, wo die Betonung hinfällt.
  • Frage- und Ausrufezeichen verändern die Betonung, Auslassungspunkte verlängern die Pause. Setz sie mit Absicht.
  • Gewöhnliche Beträge, Datumsangaben und Uhrzeiten werden gut gelesen. Alles, was man auf zwei Arten sagen kann, wie „1/2“, „3x“ oder eine Abkürzung, die man nicht buchstabiert, schreibst du so aus, wie du es hören willst.
  • Streich lange Klammern, Fußnoten, Links und Listen mit mehr als vier Punkten. Laut gelesen gehen sie unter.
  • Lies das Skript vor dem Erstellen selbst laut. Wo du stolperst, verliert sich auch der Hörer.

Eigene Pausen mit <#1.5#>

Für eine Stille, die länger ist als ein Punkt, schreibst du zwischen zwei Sätze eine Marke mit den Sekunden: <#1.5#> lässt anderthalb Sekunden, <#3#> drei, bis zu 10 pro Marke. Das hilft, in einer Geschichte die Szene zu wechseln, in einer Doku eine Einstellung wirken zu lassen oder in einer Erzählung Spannung aufzubauen.

Die Marke wird weder vorgelesen noch berechnet: Es zählen nur die Zeichen, die gesprochen werden.

In jener Nacht erlosch der Leuchtturm zum ersten Mal seit hundert Jahren. <#2#>
Niemand im Dorf konnte erklären, warum. <#1#>
Niemand, außer dem Leuchtturmwärter.

So stellst du das Tempo der Erzählerstimme ein

Der Generator hat zwei Regler. Das Tempo, von 0.5× bis 2×, bestimmt, wie schnell die Stimme spricht. Der Abstand zwischen den Sätzen, von „Fließend“ bis „Mit Pausen“ (bis zu 800 ms), bestimmt, wie viel Stille zwischen einem Satz und dem nächsten bleibt. Vor dem Erstellen kannst du die Stimme mit diesen Einstellungen anhören und sie für das nächste Mal in der Stimme speichern.

Zum Einstieg: Doku und Hörbuch in normalem Tempo oder etwas darunter, Geschichten und Horror langsamer und mit mehr Abstand, Werbung etwas schneller und mit weniger. Feinabstimmung am besten mit einem echten Absatz aus deinem Skript.

Als menschlicher Richtwert: Das National Center for Voice and Speech beziffert die durchschnittliche Unterhaltung im amerikanischen Englisch auf etwa 150 Wörter pro Minute. Eine Erzählung läuft meist etwas langsamer als ein schnelles Gespräch.

Deine Erzählung in Voizum, Schritt für Schritt

Mit fertigem Skript:

  1. 1Öffne die Stimmbibliothek und filtere nach Sprache und Stil. Fang mit „Erzählung“ an; für eine Doku probier auch „Informativ“, für Horror „Dramatisch“.
  2. 2Hör dir die Sprachprobe von drei oder vier Stimmen an und nimm die, die zur Tabelle oben passt. Es gibt über 300 Stimmen in 7 Sprachen: Deutsch, Englisch, Spanisch, Französisch, Portugiesisch, Italienisch und Russisch.
  3. 3Füge im Generator das Skript ein oder klick auf „Dokument hochladen“ (akzeptiert .txt, .md, .srt, .pdf, .docx). Die Sprache wird automatisch erkannt.
  4. 4Setz die Marken <#1.5#> dorthin, wo du eine lange Pause willst.
  5. 5Stell Tempo und Satzabstand ein und hör die Stimme damit an, bevor du erstellst. Wenn sie dir gefallen, speichere sie mit „Für diese Stimme speichern“.
  6. 6Klick auf „Erstellen“. Bevor etwas abgebucht wird, siehst du, wie viele Credits es kostet.
  7. 7Hör dir das Ergebnis an und lade die MP3 für deinen Videoeditor oder deinen Podcast herunter.

Kann ich mit meiner eigenen Stimme erzählen?

Ja, und wenn du einen Kanal, einen Kurs oder einen Podcast hast, ist das wahrscheinlich die beste Option. Aus einer Aufnahme von 15 bis 60 Sekunden erstellt Voizum eine Kopie deiner Stimme. Ab dann schreibst du das Skript, und deine Stimme liest es vor, ohne dass du noch einmal aufnehmen musst.

Nimm die Sprachprobe so auf, wie die Erzählung klingen soll. Wenn du hastig und im Ton eines Handyvideos aufnimmst, erzählt der Klon genauso. Klonen kostet 199 Credits und wird mit deinem ersten Credit-Kauf freigeschaltet.

Um in einer anderen Sprache zu erzählen, kopiert der Modus ohne Akzent nur das Timbre deiner Stimme. Und wenn du auf YouTube veröffentlichst: Laut deren Hilfeseite braucht das Klonen deiner eigenen Stimme für Voiceovers oder Synchronisationen nicht das Label für veränderte oder synthetische Inhalte.

Geschichten mit Figuren und der Dialogmodus

Im Dialogmodus markierst du am Anfang jeder Zeile, wer spricht, und alles kommt in einer einzigen Audiodatei heraus, mit bis zu 5 Figuren und 100 Sprechbeiträgen. Das Skript fügst du am Stück ein:

So schreibst du das Skript

Der Name steht in eckigen Klammern, in <> oder mit einem Doppelpunkt dahinter. Was du darunter ohne Namen schreibst, gehört weiter zu dieser Figur, ein langer Absatz braucht die Marke also nicht zu wiederholen. Danach weist du Stimmen zu: eine ruhige für den Erzähler und für die Figuren Stimmen, die sich gut voneinander unterscheiden.

[Erzähler] Der Fuchs hatte drei Tage nichts gefressen, als er den Raben auf dem Ast sah.
[Fuchs] Was für glänzende Federn! Deine Stimme ist bestimmt noch schöner.
[Rabe] Meinst du wirklich?
[Erzähler] Und der Rabe öffnete stolz den Schnabel.

Einstellungen, die helfen

Lass „Stimmen untereinander angleichen“ eingeschaltet, sonst klingt es nach zusammengeklebten Aufnahmen. Der Ausdruck reicht von „Zurückhaltend“ bis „Lebhaft“: Dreh ihn bei einer Kindergeschichte etwas hoch und lass ihn bei einem ernsten Text in der Mitte.

Hörbücher und lange Erzählungen

Eine einzelne Audiodatei fasst bis zu 600.000 Zeichen, etwa 10 Stunden Sprache, ein kurzes Buch passt also komplett hinein. Trotzdem ist bei einem Hörbuch eine Datei pro Kapitel besser: Die Hörer springen zwischen den Kapiteln, und du kannst Kapitel 7 ändern, ohne die anderen anzufassen.

Mit „Audios verketten“ erstellst du bis zu 100 Audios auf einmal, jedes mit eigenem Namen und mit nur einem einzigen Mindestbetrag für den ganzen Stapel. Wie das Klonen wird es mit deinem ersten Credit-Kauf freigeschaltet.

Bevor du ein KI-erzähltes Hörbuch veröffentlichst, schau dir die Regeln des Shops an, denn sie unterscheiden sich stark:

  • ACX (die Produktionsplattform von Audible) verlangt, dass Hörbücher von einem Menschen gesprochen werden, außer es gibt eine Genehmigung, und verbietet Text-to-Speech oder KI ohne sie.
  • Google Play Books hat ein eigenes Programm für Hörbücher mit automatischer Erzählung, vorausgesetzt, du besitzt die Audiorechte am Buch.
  • Vertone nur Texte, die du selbst geschrieben hast, für die du die Rechte hast oder die gemeinfrei sind.

Was es kostet

Wenn du dich mit deinem Google-Konto anmeldest, bekommst du jeden Monat 600 Gratis-Credits, etwa 10 Minuten Erzählung, genug, um mehrere Stimmen mit deinem eigenen Skript zu testen. Sie erneuern sich von selbst, gelten für den Generator und den Dialogmodus, und es wird keine Karte verlangt.

Danach kosten je 1.000 Zeichen 60 Credits, etwa 60 pro Audiominute. Es gibt kein Abo, und gekaufte Credits verfallen nicht.

Verwendete Quellen

  1. ACX: Audioanforderungen und menschliche Erzählung
  2. Google Play Books: Richtlinien des Programms für Hörbücher mit automatischer Erzählung
  3. YouTube: Offenlegung von veränderten oder synthetischen Inhalten
  4. National Center for Voice and Speech: Stimmqualität und Sprechtempo

Das könnte dir auch helfen

Häufige Fragen

Was ist ein KI-Sprecher?
Ein Werkzeug, das deinen Text mit einer natürlichen synthetischen Stimme vorliest. Du fügst das Skript ein, wählst die Stimme und lädst die Erzählung als MP3 herunter, ohne Mikrofon und ohne Studio.
Welche Erzählerstimme passt für eine Doku?
Tief oder mittel, ruhig und mit wenig Schnörkel, in normalem oder etwas langsamerem Tempo. Am nächsten ans Fernsehen bringen dich die Pausen zwischen den Abschnitten: In Voizum setzt du sie mit <#1.5#> oder <#2#> zwischen die Sätze.
Wie mache ich lange Pausen in der Erzählung?
Mit einer Marke zwischen zwei Sätzen, zum Beispiel <#1.5#> für anderthalb Sekunden, bis zu 10 Sekunden pro Marke. Sie wird weder vorgelesen noch berechnet. Um die Stille zwischen allen Sätzen zu ändern, nutze die Einstellung „Abstand zwischen Sätzen“.
Kann ich eine Geschichte mit mehreren Stimmen vertonen?
Ja, mit dem Dialogmodus: Du markierst am Anfang jeder Zeile, wer spricht, etwa [Erzähler] oder [Fuchs], und weist jeder Figur eine Stimme zu. Er unterstützt bis zu 5 Figuren, und alles kommt in einer Audiodatei heraus.
Kann ich meine eigene Stimme als Erzähler nutzen?
Ja. Du klonst deine Stimme aus einer Aufnahme von 15 bis 60 Sekunden, und danach liest sie jeden beliebigen Text vor. Klonen kostet 199 Credits und wird mit deinem ersten Kauf freigeschaltet.
Kann ich ein ganzes Hörbuch mit einem KI-Erzähler machen?
Ja. Eine Audiodatei fasst bis zu 600.000 Zeichen, etwa 10 Stunden, und mit „Audios verketten“ bekommst du eine Datei pro Kapitel. Prüf vor der Veröffentlichung die Regeln des Shops: ACX verlangt zum Beispiel menschliche Erzählung, außer es gibt eine Genehmigung.
Ist der KI-Sprecher für Texte kostenlos?
Ja, bis zu 600 Credits pro Monat, wenn du dich mit Google anmeldest, etwa 10 Minuten Audio für Erzählungen und Dialoge. Danach zahlst du nur, was du nutzt, ohne Abo.

Weitere Ratgeber

Gib deinen Text ein und hör ihn mit einer echten Stimme

Wenn du dich mit Google anmeldest, schenken wir dir jeden Monat 600 Credits: etwa 10 Minuten Audio.