Ratgeber
Voiceover Generator mit KI: vom Skript zum fertigen Video
Das Voizum-Team · Aktualisiert · 10 Min. Lesezeit
Ein KI-Voiceover entsteht in vier Schritten: Skript, Stimme, Schnitt, Veröffentlichung. Dieser Ratgeber hinterlegt jeden Schritt mit Zahlen: wie viele Zeichen eine Minute füllen, welche Stimme zu welchem Videotyp passt, wie du die MP3 in CapCut, Premiere, DaVinci oder PowerPoint synchronisierst, wie laut die Musik sein sollte und was YouTube und TikTok verlangen, wenn die Stimme synthetisch ist.
So machst du ein Video mit KI-Voiceover, Schritt für Schritt
Erst das Skript, dann die Stimme, zuletzt das Bild. Wer das Bild zuerst schneidet, streckt am Ende Einstellungen oder kürzt Sätze, damit die Stimme hineinpasst. Mit fertiger Stimme schneidest du das Bild im Rhythmus der Erzählung, und es passt auf Anhieb.
Der Ablauf ist für einen 40-Sekunden-Short derselbe wie für eine Dokumentation von einer Stunde:
- 1Schreibe das ganze Skript in ein Dokument, fürs Ohr gedacht. Wie das geht, steht weiter unten.
- 2Berechne die Dauer: etwa 1.000 Zeichen pro Minute. Soll das Video 8 Minuten dauern, peile etwa 8.000 an.
- 3Füge den Text in den Generator ein oder lade die Datei hoch (txt, md, srt, pdf, docx) und wähle die Stimme. Hör die Sprachprobe mit einem Satz aus deinem eigenen Skript an, nicht mit dem Beispielsatz.
- 4Erstelle das Audio und höre es an. Willst du etwas ändern, änderst du es im Text und erstellst nur diesen Teil neu.
- 5Lade die MP3 herunter und importiere sie in deinen Editor. Leg sie auf eine eigene Audiospur, ab Sekunde null.
- 6Schneide und platziere das Bild entlang der Stimme: Bei jedem neuen Gedanken ein Bildwechsel.
- 7Füge Musik auf einer anderen Spur hinzu, senke sie unter die Stimme und aktiviere die automatische Absenkung (Ducking), wenn dein Editor sie hat.
- 8Erstelle Untertitel: In sozialen Netzwerken sieht ein großer Teil des Publikums Videos ohne Ton.
- 9Exportiere, miss die Endlautstärke und veröffentliche. Wenn die Plattform es verlangt, kennzeichne den Inhalt als mit KI erstellt.
Wie viel Text brauchst du: Zeichen pro Minute
Zähle Zeichen. Das misst jeder Stimmengenerator, und es hängt nicht davon ab, wie lang deine Wörter sind. Die runde Rechnung: 1.000 Zeichen inklusive Leerzeichen pro Audiominute.
Die klassische Referenz in Wörtern stammt aus dem Englischen: Das National Center for Voice and Speech schätzt etwa 150 Wörter pro Minute für gesprochenes amerikanisches Englisch. Deutsche Wörter sind im Schnitt länger, die Zahl lässt sich deshalb nicht einfach übertragen. Verlässlich ist, mit der Stimme, die du nutzen willst, eine Testminute zu erstellen und das Skript an die tatsächliche Dauer anzupassen.
| Videolänge | Skript-Zeichen (runde Rechnung) | Tatsächliche Spanne je nach Stimme | Credits |
|---|---|---|---|
| 1 min | 1.000 | 870 – 1.290 | 100 |
| 3 min | 3.000 | 2.610 – 3.870 | 180 |
| 8 min | 8.000 | 6.960 – 10.320 | 480 |
| 15 min | 15.000 | 13.050 – 19.350 | 900 |
| 30 min | 30.000 | 26.100 – 38.700 | 1.800 |
| 1 Stunde | 60.000 | 52.200 – 77.400 | 3.600 |
So schreibst du ein Skript fürs Voiceover
Wer zuhört, kann nicht zurückspringen und nachlesen. Jeder Satz muss beim ersten Hören verständlich sein.
- Sätze mit höchstens 15 bis 25 Wörtern. Braucht ein Satz zwei Kommas und eine Klammer, teile ihn in zwei.
- Ein Gedanke pro Satz und die wichtige Information am Ende, wo die Betonung des Satzes liegt.
- Beträge, Datumsangaben, Uhrzeiten und Preise werden von allein gut gelesen. Kürzel und ungewöhnliche Symbole schreibst du dagegen so, wie sie klingen sollen: „Ka-Ge“ oder „dreimal“ statt „3x“.
- Die Zeichensetzung gibt den Rhythmus vor. Der Punkt macht eine Pause, das Komma lässt Luft holen; ein Skript ohne Punkte wird in einem Zug gelesen.
- Keine langen Listen vorlesen. Ab vier Punkten verlieren die Leute den Überblick: Zeig sie auf dem Bildschirm und lass die Stimme nur die zwei wichtigen nennen.
- Lies das Skript selbst laut, bevor du erstellst. Wo du stolperst, klingt auch die Stimme gezwungen.
Der Einstieg bei kurzen Videos
Bei TikTok, Reels und Shorts entscheidet der erste Satz, ob die Leute bleiben. Beginne mit dem Versprechen oder der auffälligsten Information, nie mit „Hallo zusammen, heute schauen wir uns an“. Die Vorstellung, falls nötig, kommt nach dem Einstieg.
Pausen nach Maß
Brauchst du eine genaue Stille, während eine Grafik einläuft? Schreibe <#1.5#> zwischen die zwei Sätze, mit so vielen Sekunden, wie du willst. Die Marke wird weder gelesen noch berechnet. Den allgemeinen Abstand zwischen den Sätzen wählst du getrennt in den Einstellungen, von „Fließend“ bis „Mit Pausen“.
Welche Stimme für welchen Videotyp
Den Ton gibt die Stimme vor dem Bild vor. Wähle mit deinem Skript vor Augen: Die Stimme, die zu einem Tutorial passt, kann eine Werbung einschläfern.
| Videotyp | Welche Stimme passt | Tempo | Tipp |
|---|---|---|---|
| Dokumentation, Geschichte, True Crime | Tiefer, gemächlicher Erzähler | Langsam | Lange, gut gesetzte Sätze und Pausen vor jeder Enthüllung |
| Tutorial, Kurs, Erklärvideo | Klare, nahbare Stimme ohne Theater | Mittel | Ein Schritt pro Satz; was auf dem Bildschirm zu sehen ist, heißt wie im Skript |
| Werbung und Promo | Stimme mit Werbeenergie | Mittel bis schnell | Produkt und Nutzen in den ersten 5 Sekunden; der Handlungsaufruf am Ende, allein |
| Kindergeschichte und Erzählung | Warme, ausdrucksstarke Stimme | Langsam | Im Dialogmodus mehr „Ausdruck“ geben und bei Szenenwechseln Pausen lassen |
| Shorts, Reels und TikTok | Gesprächige Stimme, als erzählte es dir jemand | Schnell | Einstieg im ersten Satz und keine Einleitung |
| Nachrichten und Zusammenfassungen | Neutrale Sprecherstimme | Mittel | Daten und Zahlen so schreiben, wie man sie spricht |
Stimme aus der Bibliothek oder deine eigene geklonte Stimme?
Wenn die Leute deine Stimme schon kennen, klone sie, dann klingen die Videos auch an Tagen nach dir, an denen du nicht aufnimmst. Bei einem Kanal ohne Gesicht und ohne bekannte Stimme, den sogenannten Faceless-Kanälen, erspart dir eine Stimme aus der Stimmbibliothek diesen Schritt, und du wechselst sie je nach Serie oder Sprache.
Stimmen aus der Bibliothek
Es gibt über 300 Stimmen in 7 Sprachen: Deutsch, Englisch, Spanisch, Französisch, Portugiesisch, Italienisch und Russisch. Jede hat eine Sprachprobe zum Vorhören, und du kannst Tempo und Lautstärke einstellen und mit „Für diese Stimme speichern“ festhalten, damit alle deine Videos gleich klingen.
Deine geklonte Stimme
Du brauchst 15 bis 60 Sekunden saubere Aufnahme einer einzelnen Person. Das Klonen kostet einmalig 199 Credits und setzt voraus, dass du schon einmal Credits gekauft hast. Die Betonung wird übernommen: Nimmst du die Probe monoton auf, wird die Erzählung monoton. Du darfst nur deine eigene Stimme oder die einer Person klonen, die es dir erlaubt hat.
- Nimm in einem Raum mit Möbeln oder Vorhängen auf, ohne Musik und Hintergrundgeräusche.
- Schneide die Aufnahme in einer Pause, nie mitten im Wort, und lass am Ende knapp unter eine Sekunde Stille.
- Wiederhole keinen kurzen Clip in Schleife, um ihn zu verlängern: Das macht den Klon schlechter statt besser.
So baust du das Voiceover in CapCut, Premiere, DaVinci und PowerPoint ein
Die Menüs unterscheiden sich, das Prinzip nicht: Die MP3 liegt auf einer eigenen Audiospur, beginnt bei Sekunde null, und das Bild richtet sich nach ihr.
CapCut (Desktop und Handy)
Der schnellste Weg für TikTok, Reels und Shorts.
- Klicke auf Importieren und füge das Video oder die Bilder und die MP3 der Stimme hinzu.
- Ziehe die MP3 auf die Zeitleiste, unter die Videospur, am Anfang ausgerichtet.
- Zoome in die Zeitleiste und teile die Bildclips (Teilen) dort, wo die Stimme zu einem neuen Gedanken wechselt.
- Wähle die Musik aus und senke ihre Lautstärke im Audiobereich; mit Lautstärke-Keyframes kannst du sie nur absenken, solange gesprochen wird.
- Wähle bei Untertitel die automatischen Untertitel mit der Sprache der Stimme und prüfe den erzeugten Text.
Premiere Pro
- Datei > Importieren (Strg+I) und ziehe die MP3 auf Spur A1, die Musik auf A2.
- Weise im Bedienfeld Essential Sound die Stimme als Dialog und die Musik als Musik zu.
- Aktiviere bei markierter Musik das Ducking mit Dialog als Bezug, stelle ein, wie weit sie absinkt, und lass die Keyframes erzeugen.
- Schneide die Einstellungen auf der Videospur entlang der Sätze der Stimme.
DaVinci Resolve
- Importiere die MP3 in den Media Pool und ziehe sie auf der Seite Edit auf eine Audiospur.
- Lege die Musik auf eine andere Spur.
- Öffne auf der Seite Fairlight die Dynamik der Musikspur, aktiviere den Kompressor und wähle als Sidechain-Quelle die Spur der Stimme.
- Senke den Schwellenwert, bis die Musik zurückweicht, sobald die Stimme einsetzt; ein Verhältnis von 3:1 bis 5:1 ist ein guter Ausgangspunkt.
PowerPoint
Am bequemsten ist ein Audio pro Folie: Erstelle für jede ein Stück (mit „Audios verketten“ erstellst du bis zu 100 auf einmal).
- Auf jeder Folie: Einfügen > Audio > Audio auf meinem PC und wähle die MP3 der Folie.
- Stelle bei ausgewähltem Audiosymbol auf der Registerkarte Wiedergabe den Start auf Automatisch.
- Deaktiviere unter Übergänge die Option Bei Mausklick und setze Nach auf die Dauer dieses Audios.
- Um daraus ein Video zu machen: Datei > Exportieren > Video erstellen, mit „Aufgezeichnete Zeitabläufe und Kommentare verwenden“, als MP4.
Wie laut darf die Hintergrundmusik sein?
Eine praktische Faustregel beim Schnitt: Spitzen der Stimme zwischen −12 und −6 dB und die Musik etwa 20 dB darunter, solange gesprochen wird. Hat die Musik Gesang oder viel Schlagzeug, senke sie noch weiter.
Die automatische Absenkung, das Ducking, senkt die Musik, wenn die Stimme einsetzt, und hebt sie in den Pausen wieder an. Premiere hat sie im Bedienfeld Essential Sound, DaVinci löst sie mit einem Kompressor mit Sidechain, und in CapCut machst du sie von Hand mit Lautstärke-Keyframes.
Miss vor dem Export die integrierte Lautheit des gesamten Mixes in LUFS. Diese Richtwerte veröffentlichen die Plattformen selbst:
| Ziel | Integrierte Lautheit | Max. True Peak | Quelle |
|---|---|---|---|
| Spotify (und Streaming-Musik) | −14 LUFS | −1 dBTP | Spotify for Artists |
| Apple Podcasts | −16 LKFS (±1 dB) | −1 dBFS | Apple Podcasts for Creators |
Stundenlange Erzählung in einem einzigen Audio
Eine einstündige Dokumentation, ein Kurs oder ein Hörbuch lassen sich in einem Durchgang erstellen: Jedes Audio fasst bis zu 600.000 Zeichen, etwa 10 Stunden Sprache (zwischen 7 und 12, je nachdem, wie schnell die Stimme ist). Ohne das Skript zu teilen, gibt es keine zwei Hälften mit unterschiedlichem Ton.
Wenn du lieber mehrere Teile willst (ein Audio pro Kapitel oder pro Folie), erstellt „Audios verketten“ bis zu 100 auf einmal mit ihren Namen. Diese Funktion nutzt gekaufte Credits; die Gratis-Credits gelten nur fürs Erstellen auf der Website.
Darf ich die KI-Stimme auf YouTube, TikTok und in Werbung nutzen?
Ja: in monetarisierten Videos, Werbung und Kundenprojekten. Nicht erlaubt sind das Ausgeben als jemand anderes und illegale Inhalte.
YouTube verlangt, dass du beim Hochladen (Option für veränderte oder synthetische Inhalte) kennzeichnest, was echt wirkt und mit KI erzeugt oder verändert wurde, etwa wenn eine echte Person etwas zu sagen scheint, was sie nicht gesagt hat. Auf der Ausnahmeliste stehen auch das Klonen der eigenen Stimme für Voiceover oder Synchronisation und der Einsatz von KI für Skript oder Untertitel.
Die Monetarisierung ist eine andere Frage. Seit Juli 2025 nennt YouTube massenhaft produzierte oder repetitive Inhalte „nicht authentisch“ und wendet das auch auf KI-Videos aus generischen Vorlagen ohne eigenen Beitrag an. Ein Kanal mit austauschbaren Videos riskiert das mit oder ohne synthetische Stimme. Dich schützt ein originelles Skript mit eigener Recherche und eigener Sichtweise.
TikTok verlangt, bei realistischen Inhalten die Kennzeichnung für KI-erzeugte Inhalte zu aktivieren, und verbietet sie in jedem Fall, wenn sie über echte Personen oder Ereignisse täuschen.
Häufige Fehler und wie das Voiceover besser klingt
Fast alle lassen sich beheben, indem du den Text vor dem Erstellen umschreibst.
- Einen Artikel oder ein PDF einfach einfügen. Es klingt, als läse jemand eine Broschüre vor.
- „1/2“ oder „GmbH“ nicht so schreiben, wie sie klingen: Sie können unerwartet gelesen werden.
- Die Stimme nach ihrem Beispielsatz wählen statt mit deinem eigenen Skript.
- Musik zu laut oder mit Gesang unter der Stimme.
- Zuerst das Bild schneiden und die Stimme zwingen, hineinzupassen.
- 20 Minuten erstellen, ohne vorher eine Minute zu testen.
- Den „Ausdruck“ auf Maximum drehen, damit es lebendiger klingt: Zu viel davon nimmt ihr die Natürlichkeit.
- Untertitel bei Videos für soziale Netzwerke vergessen.
Verwendete Quellen
- YouTube-Hilfe: Offenlegung von veränderten oder synthetischen Inhalten
- YouTube-Hilfe: Richtlinien zur Monetarisierung im Partnerprogramm
- TikTok: KI-generierte Inhalte
- National Center for Voice and Speech: Stimmqualität und Sprechtempo
- Spotify for Artists: Lautheitsnormalisierung
- Apple Podcasts for Creators: Audioanforderungen
- Microsoft: Hinzufügen oder Löschen von Audio in PowerPoint
- Microsoft: Eine Präsentation in ein Video umwandeln
- Adobe: Audio in Premiere automatisch absenken
- Larry Jordan: Automatisches Ducking in DaVinci Resolve
- CapCut: Untertitel erstellen
- DIY Video Studio: Audiopegel für Video