Voizum

Ratgeber

Voiceover Generator mit KI: vom Skript zum fertigen Video

Das Voizum-Team · Aktualisiert · 10 Min. Lesezeit

Ein KI-Voiceover entsteht in vier Schritten: Skript, Stimme, Schnitt, Veröffentlichung. Dieser Ratgeber hinterlegt jeden Schritt mit Zahlen: wie viele Zeichen eine Minute füllen, welche Stimme zu welchem Videotyp passt, wie du die MP3 in CapCut, Premiere, DaVinci oder PowerPoint synchronisierst, wie laut die Musik sein sollte und was YouTube und TikTok verlangen, wenn die Stimme synthetisch ist.

So machst du ein Video mit KI-Voiceover, Schritt für Schritt

Erst das Skript, dann die Stimme, zuletzt das Bild. Wer das Bild zuerst schneidet, streckt am Ende Einstellungen oder kürzt Sätze, damit die Stimme hineinpasst. Mit fertiger Stimme schneidest du das Bild im Rhythmus der Erzählung, und es passt auf Anhieb.

Der Ablauf ist für einen 40-Sekunden-Short derselbe wie für eine Dokumentation von einer Stunde:

  1. 1Schreibe das ganze Skript in ein Dokument, fürs Ohr gedacht. Wie das geht, steht weiter unten.
  2. 2Berechne die Dauer: etwa 1.000 Zeichen pro Minute. Soll das Video 8 Minuten dauern, peile etwa 8.000 an.
  3. 3Füge den Text in den Generator ein oder lade die Datei hoch (txt, md, srt, pdf, docx) und wähle die Stimme. Hör die Sprachprobe mit einem Satz aus deinem eigenen Skript an, nicht mit dem Beispielsatz.
  4. 4Erstelle das Audio und höre es an. Willst du etwas ändern, änderst du es im Text und erstellst nur diesen Teil neu.
  5. 5Lade die MP3 herunter und importiere sie in deinen Editor. Leg sie auf eine eigene Audiospur, ab Sekunde null.
  6. 6Schneide und platziere das Bild entlang der Stimme: Bei jedem neuen Gedanken ein Bildwechsel.
  7. 7Füge Musik auf einer anderen Spur hinzu, senke sie unter die Stimme und aktiviere die automatische Absenkung (Ducking), wenn dein Editor sie hat.
  8. 8Erstelle Untertitel: In sozialen Netzwerken sieht ein großer Teil des Publikums Videos ohne Ton.
  9. 9Exportiere, miss die Endlautstärke und veröffentliche. Wenn die Plattform es verlangt, kennzeichne den Inhalt als mit KI erstellt.

Wie viel Text brauchst du: Zeichen pro Minute

Zähle Zeichen. Das misst jeder Stimmengenerator, und es hängt nicht davon ab, wie lang deine Wörter sind. Die runde Rechnung: 1.000 Zeichen inklusive Leerzeichen pro Audiominute.

Die klassische Referenz in Wörtern stammt aus dem Englischen: Das National Center for Voice and Speech schätzt etwa 150 Wörter pro Minute für gesprochenes amerikanisches Englisch. Deutsche Wörter sind im Schnitt länger, die Zahl lässt sich deshalb nicht einfach übertragen. Verlässlich ist, mit der Stimme, die du nutzen willst, eine Testminute zu erstellen und das Skript an die tatsächliche Dauer anzupassen.

VideolängeSkript-Zeichen (runde Rechnung)Tatsächliche Spanne je nach StimmeCredits
1 min1.000870 – 1.290100
3 min3.0002.610 – 3.870180
8 min8.0006.960 – 10.320480
15 min15.00013.050 – 19.350900
30 min30.00026.100 – 38.7001.800
1 Stunde60.00052.200 – 77.4003.600
Credits mit 60 pro 1.000 Zeichen, mindestens 100 pro Audio. Mit deinem Google-Konto bekommst du 600 Gratis-Credits im Monat, etwa 10 Minuten Voiceover.

So schreibst du ein Skript fürs Voiceover

Wer zuhört, kann nicht zurückspringen und nachlesen. Jeder Satz muss beim ersten Hören verständlich sein.

  • Sätze mit höchstens 15 bis 25 Wörtern. Braucht ein Satz zwei Kommas und eine Klammer, teile ihn in zwei.
  • Ein Gedanke pro Satz und die wichtige Information am Ende, wo die Betonung des Satzes liegt.
  • Beträge, Datumsangaben, Uhrzeiten und Preise werden von allein gut gelesen. Kürzel und ungewöhnliche Symbole schreibst du dagegen so, wie sie klingen sollen: „Ka-Ge“ oder „dreimal“ statt „3x“.
  • Die Zeichensetzung gibt den Rhythmus vor. Der Punkt macht eine Pause, das Komma lässt Luft holen; ein Skript ohne Punkte wird in einem Zug gelesen.
  • Keine langen Listen vorlesen. Ab vier Punkten verlieren die Leute den Überblick: Zeig sie auf dem Bildschirm und lass die Stimme nur die zwei wichtigen nennen.
  • Lies das Skript selbst laut, bevor du erstellst. Wo du stolperst, klingt auch die Stimme gezwungen.

Der Einstieg bei kurzen Videos

Bei TikTok, Reels und Shorts entscheidet der erste Satz, ob die Leute bleiben. Beginne mit dem Versprechen oder der auffälligsten Information, nie mit „Hallo zusammen, heute schauen wir uns an“. Die Vorstellung, falls nötig, kommt nach dem Einstieg.

Pausen nach Maß

Brauchst du eine genaue Stille, während eine Grafik einläuft? Schreibe <#1.5#> zwischen die zwei Sätze, mit so vielen Sekunden, wie du willst. Die Marke wird weder gelesen noch berechnet. Den allgemeinen Abstand zwischen den Sätzen wählst du getrennt in den Einstellungen, von „Fließend“ bis „Mit Pausen“.

Welche Stimme für welchen Videotyp

Den Ton gibt die Stimme vor dem Bild vor. Wähle mit deinem Skript vor Augen: Die Stimme, die zu einem Tutorial passt, kann eine Werbung einschläfern.

VideotypWelche Stimme passtTempoTipp
Dokumentation, Geschichte, True CrimeTiefer, gemächlicher ErzählerLangsamLange, gut gesetzte Sätze und Pausen vor jeder Enthüllung
Tutorial, Kurs, ErklärvideoKlare, nahbare Stimme ohne TheaterMittelEin Schritt pro Satz; was auf dem Bildschirm zu sehen ist, heißt wie im Skript
Werbung und PromoStimme mit WerbeenergieMittel bis schnellProdukt und Nutzen in den ersten 5 Sekunden; der Handlungsaufruf am Ende, allein
Kindergeschichte und ErzählungWarme, ausdrucksstarke StimmeLangsamIm Dialogmodus mehr „Ausdruck“ geben und bei Szenenwechseln Pausen lassen
Shorts, Reels und TikTokGesprächige Stimme, als erzählte es dir jemandSchnellEinstieg im ersten Satz und keine Einleitung
Nachrichten und ZusammenfassungenNeutrale SprecherstimmeMittelDaten und Zahlen so schreiben, wie man sie spricht

Stimme aus der Bibliothek oder deine eigene geklonte Stimme?

Wenn die Leute deine Stimme schon kennen, klone sie, dann klingen die Videos auch an Tagen nach dir, an denen du nicht aufnimmst. Bei einem Kanal ohne Gesicht und ohne bekannte Stimme, den sogenannten Faceless-Kanälen, erspart dir eine Stimme aus der Stimmbibliothek diesen Schritt, und du wechselst sie je nach Serie oder Sprache.

Stimmen aus der Bibliothek

Es gibt über 300 Stimmen in 7 Sprachen: Deutsch, Englisch, Spanisch, Französisch, Portugiesisch, Italienisch und Russisch. Jede hat eine Sprachprobe zum Vorhören, und du kannst Tempo und Lautstärke einstellen und mit „Für diese Stimme speichern“ festhalten, damit alle deine Videos gleich klingen.

Deine geklonte Stimme

Du brauchst 15 bis 60 Sekunden saubere Aufnahme einer einzelnen Person. Das Klonen kostet einmalig 199 Credits und setzt voraus, dass du schon einmal Credits gekauft hast. Die Betonung wird übernommen: Nimmst du die Probe monoton auf, wird die Erzählung monoton. Du darfst nur deine eigene Stimme oder die einer Person klonen, die es dir erlaubt hat.

  • Nimm in einem Raum mit Möbeln oder Vorhängen auf, ohne Musik und Hintergrundgeräusche.
  • Schneide die Aufnahme in einer Pause, nie mitten im Wort, und lass am Ende knapp unter eine Sekunde Stille.
  • Wiederhole keinen kurzen Clip in Schleife, um ihn zu verlängern: Das macht den Klon schlechter statt besser.

So baust du das Voiceover in CapCut, Premiere, DaVinci und PowerPoint ein

Die Menüs unterscheiden sich, das Prinzip nicht: Die MP3 liegt auf einer eigenen Audiospur, beginnt bei Sekunde null, und das Bild richtet sich nach ihr.

CapCut (Desktop und Handy)

Der schnellste Weg für TikTok, Reels und Shorts.

  • Klicke auf Importieren und füge das Video oder die Bilder und die MP3 der Stimme hinzu.
  • Ziehe die MP3 auf die Zeitleiste, unter die Videospur, am Anfang ausgerichtet.
  • Zoome in die Zeitleiste und teile die Bildclips (Teilen) dort, wo die Stimme zu einem neuen Gedanken wechselt.
  • Wähle die Musik aus und senke ihre Lautstärke im Audiobereich; mit Lautstärke-Keyframes kannst du sie nur absenken, solange gesprochen wird.
  • Wähle bei Untertitel die automatischen Untertitel mit der Sprache der Stimme und prüfe den erzeugten Text.

Premiere Pro

  • Datei > Importieren (Strg+I) und ziehe die MP3 auf Spur A1, die Musik auf A2.
  • Weise im Bedienfeld Essential Sound die Stimme als Dialog und die Musik als Musik zu.
  • Aktiviere bei markierter Musik das Ducking mit Dialog als Bezug, stelle ein, wie weit sie absinkt, und lass die Keyframes erzeugen.
  • Schneide die Einstellungen auf der Videospur entlang der Sätze der Stimme.

DaVinci Resolve

  • Importiere die MP3 in den Media Pool und ziehe sie auf der Seite Edit auf eine Audiospur.
  • Lege die Musik auf eine andere Spur.
  • Öffne auf der Seite Fairlight die Dynamik der Musikspur, aktiviere den Kompressor und wähle als Sidechain-Quelle die Spur der Stimme.
  • Senke den Schwellenwert, bis die Musik zurückweicht, sobald die Stimme einsetzt; ein Verhältnis von 3:1 bis 5:1 ist ein guter Ausgangspunkt.

PowerPoint

Am bequemsten ist ein Audio pro Folie: Erstelle für jede ein Stück (mit „Audios verketten“ erstellst du bis zu 100 auf einmal).

  • Auf jeder Folie: Einfügen > Audio > Audio auf meinem PC und wähle die MP3 der Folie.
  • Stelle bei ausgewähltem Audiosymbol auf der Registerkarte Wiedergabe den Start auf Automatisch.
  • Deaktiviere unter Übergänge die Option Bei Mausklick und setze Nach auf die Dauer dieses Audios.
  • Um daraus ein Video zu machen: Datei > Exportieren > Video erstellen, mit „Aufgezeichnete Zeitabläufe und Kommentare verwenden“, als MP4.

Wie laut darf die Hintergrundmusik sein?

Eine praktische Faustregel beim Schnitt: Spitzen der Stimme zwischen −12 und −6 dB und die Musik etwa 20 dB darunter, solange gesprochen wird. Hat die Musik Gesang oder viel Schlagzeug, senke sie noch weiter.

Die automatische Absenkung, das Ducking, senkt die Musik, wenn die Stimme einsetzt, und hebt sie in den Pausen wieder an. Premiere hat sie im Bedienfeld Essential Sound, DaVinci löst sie mit einem Kompressor mit Sidechain, und in CapCut machst du sie von Hand mit Lautstärke-Keyframes.

Miss vor dem Export die integrierte Lautheit des gesamten Mixes in LUFS. Diese Richtwerte veröffentlichen die Plattformen selbst:

ZielIntegrierte LautheitMax. True PeakQuelle
Spotify (und Streaming-Musik)−14 LUFS−1 dBTPSpotify for Artists
Apple Podcasts−16 LKFS (±1 dB)−1 dBFSApple Podcasts for Creators
LUFS und LKFS messen dasselbe. YouTube veröffentlicht keinen offiziellen Wert; für Video klingt ein Mix zwischen −14 und −16 LUFS mit Spitzen unter −1 dB fast überall gut.

Stundenlange Erzählung in einem einzigen Audio

Eine einstündige Dokumentation, ein Kurs oder ein Hörbuch lassen sich in einem Durchgang erstellen: Jedes Audio fasst bis zu 600.000 Zeichen, etwa 10 Stunden Sprache (zwischen 7 und 12, je nachdem, wie schnell die Stimme ist). Ohne das Skript zu teilen, gibt es keine zwei Hälften mit unterschiedlichem Ton.

Wenn du lieber mehrere Teile willst (ein Audio pro Kapitel oder pro Folie), erstellt „Audios verketten“ bis zu 100 auf einmal mit ihren Namen. Diese Funktion nutzt gekaufte Credits; die Gratis-Credits gelten nur fürs Erstellen auf der Website.

Darf ich die KI-Stimme auf YouTube, TikTok und in Werbung nutzen?

Ja: in monetarisierten Videos, Werbung und Kundenprojekten. Nicht erlaubt sind das Ausgeben als jemand anderes und illegale Inhalte.

YouTube verlangt, dass du beim Hochladen (Option für veränderte oder synthetische Inhalte) kennzeichnest, was echt wirkt und mit KI erzeugt oder verändert wurde, etwa wenn eine echte Person etwas zu sagen scheint, was sie nicht gesagt hat. Auf der Ausnahmeliste stehen auch das Klonen der eigenen Stimme für Voiceover oder Synchronisation und der Einsatz von KI für Skript oder Untertitel.

Die Monetarisierung ist eine andere Frage. Seit Juli 2025 nennt YouTube massenhaft produzierte oder repetitive Inhalte „nicht authentisch“ und wendet das auch auf KI-Videos aus generischen Vorlagen ohne eigenen Beitrag an. Ein Kanal mit austauschbaren Videos riskiert das mit oder ohne synthetische Stimme. Dich schützt ein originelles Skript mit eigener Recherche und eigener Sichtweise.

TikTok verlangt, bei realistischen Inhalten die Kennzeichnung für KI-erzeugte Inhalte zu aktivieren, und verbietet sie in jedem Fall, wenn sie über echte Personen oder Ereignisse täuschen.

Häufige Fehler und wie das Voiceover besser klingt

Fast alle lassen sich beheben, indem du den Text vor dem Erstellen umschreibst.

  • Einen Artikel oder ein PDF einfach einfügen. Es klingt, als läse jemand eine Broschüre vor.
  • „1/2“ oder „GmbH“ nicht so schreiben, wie sie klingen: Sie können unerwartet gelesen werden.
  • Die Stimme nach ihrem Beispielsatz wählen statt mit deinem eigenen Skript.
  • Musik zu laut oder mit Gesang unter der Stimme.
  • Zuerst das Bild schneiden und die Stimme zwingen, hineinzupassen.
  • 20 Minuten erstellen, ohne vorher eine Minute zu testen.
  • Den „Ausdruck“ auf Maximum drehen, damit es lebendiger klingt: Zu viel davon nimmt ihr die Natürlichkeit.
  • Untertitel bei Videos für soziale Netzwerke vergessen.

Verwendete Quellen

  1. YouTube-Hilfe: Offenlegung von veränderten oder synthetischen Inhalten
  2. YouTube-Hilfe: Richtlinien zur Monetarisierung im Partnerprogramm
  3. TikTok: KI-generierte Inhalte
  4. National Center for Voice and Speech: Stimmqualität und Sprechtempo
  5. Spotify for Artists: Lautheitsnormalisierung
  6. Apple Podcasts for Creators: Audioanforderungen
  7. Microsoft: Hinzufügen oder Löschen von Audio in PowerPoint
  8. Microsoft: Eine Präsentation in ein Video umwandeln
  9. Adobe: Audio in Premiere automatisch absenken
  10. Larry Jordan: Automatisches Ducking in DaVinci Resolve
  11. CapCut: Untertitel erstellen
  12. DIY Video Studio: Audiopegel für Video

Das könnte dir auch helfen

Häufige Fragen

Was ist ein Voiceover?
Eine Stimme, die über dem Bild erzählt, ohne dass man den Sprecher sieht, etwa in einer Dokumentation oder einem Tutorial. Mit KI entsteht sie aus einem Text statt aus einer Aufnahme.
Kann ich auf YouTube ein Video mit KI-Stimme monetarisieren?
Ja. YouTube verbietet synthetische Stimmen nicht; nicht monetarisiert werden massenhaft produzierte oder repetitive Inhalte ohne eigenen Beitrag. Zeigt das Video etwas Realistisches, das nicht passiert ist, musst du es beim Hochladen als verändert oder synthetisch kennzeichnen.
Wie mache ich ein KI-Voiceover kostenlos?
Mit deinem Google-Konto bekommst du jeden Monat 600 Gratis-Credits, etwa 10 Minuten Sprache, um auf der Website zu erstellen und die MP3 herunterzuladen. Für sehr kurze Clips kannst du auch die integrierte Stimme von CapCut nutzen.
Wie vertone ich ein Video in CapCut?
Erstelle die Stimme, importiere sie in CapCut über Importieren und ziehe sie auf die Zeitleiste unter das Video. Schneide das Bild dort, wo die Stimme zu einem neuen Gedanken wechselt, und füge am Ende automatische Untertitel hinzu.
Wie vertone ich ein Video mit meiner Stimme, ohne jedes Mal aufzunehmen?
Klone deine Stimme einmal mit 15 bis 60 Sekunden sauberer Aufnahme. Danach schreibst du das Skript, und deine Stimme liest es vor, auch in anderen Sprachen.
Wie viele Wörter hat eine Minute Voiceover?
Im Englischen etwa 150. Im Deutschen ist es verlässlicher, Zeichen zu zählen: etwa 1.000 pro Minute, zwischen 870 und 1.290, je nachdem, wie schnell die Stimme ist.
Gibt es ein Voiceover auf Deutsch mit KI?
Ja. Die Stimmbibliothek enthält deutsche Stimmen, und die Sprache wird automatisch aus deinem Text erkannt. Hör dir die Sprachprobe an und teste die Stimme mit einem Absatz aus deinem Skript.

Weitere Ratgeber

Gib deinen Text ein und hör ihn mit einer echten Stimme

Wenn du dich mit Google anmeldest, schenken wir dir jeden Monat 600 Credits: etwa 10 Minuten Audio.