Ratgeber
Microsoft SAM: die alte Computerstimme und was du heute nutzt
Das Voizum-Team · Aktualisiert · 7 Min. Lesezeit
Microsoft SAM aus Windows 2000 und XP ist die bekannteste Computerstimme überhaupt. Als Produkt gibt es sie nicht mehr: Mit Windows Vista wurde sie als Standardstimme abgelöst. Wer den Klang zurückwill, hat drei Wege: die kostenlosen Stimmen, die dein System mitbringt, Webseiten, die ihn nachahmen, oder eine KI-Stimme, die ein ganzes Skript ruhig wie ein Sprecher liest und dir eine MP3 gibt. Unten steht, was SAM war, warum es so klang und wie du es heute löst.
Die Computerstimmen, an die sich alle erinnern
Wer in den 2000ern online aufgewachsen ist, kennt Computersprache vor allem von einer Stimme: Microsoft SAM, der männlichen Standardstimme von Windows 2000 und Windows XP, die in unzähligen frühen YouTube-Sketchen sprach. Wer „TTS SAM“ oder „Computerstimme“ sucht, meint meist genau diesen Klang.
Sie war verständlich, ein wenig metallisch und flach. Dieser Makel wurde zum Markenzeichen: Ein ausdrucksloser Roboter, der etwas Absurdes vorliest, war der halbe Witz.
| Stimme | Woher sie kam | Was aus ihr wurde |
|---|---|---|
| Microsoft SAM | Englische Standardstimme in Windows 2000 und XP | Ab Windows Vista als Standard von Microsoft Anna abgelöst |
| Software Automatic Mouth (SAM) | Ein Sprachprogramm der frühen 1980er für Heimcomputer wie den Commodore 64 | Historisches Programm, nicht zu verwechseln mit der Windows-Stimme gleichen Namens |
| Stimmen des Betriebssystems heute (Windows, macOS, Android, iPhone) | Mit dem System mitgeliefert | Kostenlos nutzbar, klingen deutlich klarer als SAM |
Kann man Microsoft SAM heute noch herunterladen?
Nicht als offizielle Stimme in aktuellem Windows. SAM war Teil von Windows selbst und wurde mit Windows Vista als Standardstimme ersetzt. Was heute als „SAM TTS Download“ oder „Microsoft SAM portable“ kursiert, sind entweder Nachbauten oder unbekannte Installationsprogramme, keine Microsoft-Produkte.
Und genau das ist die Art Download, die am häufigsten Infektionen mitbringt. In einer Studie der National University of Singapore im Auftrag von Microsoft setzten 100 % der untersuchten Seiten, die Raubkopien anboten, Nutzer Sicherheitsrisiken aus, und Trojaner waren der häufigste Schadcode in den heruntergeladenen Kopien (51 % der Infektionen).
- Installationsprogramme, die dich bitten, den Virenscanner auszuschalten, „damit der Crack läuft“.
- Ausführbare Dateien, versteckt in einem passwortgeschützten .zip oder .rar.
- Programme von 2008, die sich unter aktuellem Windows nicht sauber installieren lassen und „Patches“ verlangen.
Was du statt SAM nutzen kannst
Entscheide zuerst, was du eigentlich willst: den exakten Roboterklang der alten Videos oder einen Sprecher, der dein Skript klar liest. Beides zugleich bekommst du nirgends.
| Option | Kosten | Klang | Wofür sie taugt |
|---|---|---|---|
| Stimmen des Systems (Windows, Android, iPhone, Mac) | Kostenlos | Synthetisch und flach, dem alten Stil nah | Ein einzelner Satz, ein Meme, etwas sofort vorlesen |
| Webseiten, die SAM nachahmen | Kostenlos mit Zeichenlimit, danach kostenpflichtig | Unterschiedlich: inoffiziell, und viele nennen die verwendete Technik nicht | Kurze Sätze ausprobieren, ohne etwas zu installieren |
| KI-Stimmen (wie Voizum) | 600 Gratis-Credits pro Monat mit Google-Anmeldung; danach rund 60 Credits pro Minute Audio | Natürlich, wie ein Sprecher | Ein langes Skript für ein Video vertonen und als MP3 herunterladen |
Die Stimmen, die dein Gerät schon hat
Windows bringt deutsche Stimmen mit (in den Einstellungen unter „Zeit und Sprache“), und die Sprachausgabe nutzt sie zum Vorlesen. macOS hat „Lesen & Sprechen“ in den Bedienungshilfen, Android und iPhone haben eigene Sprachausgaben. Für einen Spaßsatz reichen sie völlig und kosten nichts. Der Haken ist das Speichern: Zum Einbauen in ein Video müsstest du den Bildschirm oder den Systemton aufnehmen.
Seiten für Retro- und Roboterstimmen
Wer „Microsoft SAM online“ oder „TTS Roboterstimme“ sucht, findet Seiten, die den alten Klang nachbauen. Keine davon ist ein Microsoft-Produkt, und die meisten sagen nicht, mit welcher Technik sie die Stimme erzeugen. Für genau diesen Roboterklang in einem Meme sind sie am nächsten dran, die kostenlosen Stufen enden aber meist bei ein paar hundert Zeichen.
KI-Stimmen für ein ganzes Skript
Kanäle, die 2008 SAM genommen hätten, fügen heute das Skript ein, wählen eine Stimme und laden eine MP3 für den Schnitt herunter. Ein Video von 15 Minuten mit so einer Stimme hält man bis zum Ende aus; bei einer metallischen Stimme klicken die Leute früher weg.
So bekommst du mit KI-Stimme den Ton eines klassischen Erzählers
Nachbauen kannst du den Ton: ein ernster, gleichmäßiger Sprecher, der alles mit derselben Ruhe vorträgt. So geht das in Voizum:
- 1Öffne „Stimmen“ und filtere nach Deutsch. Hör dir die Sprachprobe mehrerer an, bevor du wählst; für einen nüchternen Ton such eine tiefe, ruhige männliche Stimme.
- 2Im Dialogmodus kannst du den „Ausdruck“ Richtung „Zurückhaltend“ stellen. Die Stimme legt weniger Gefühl hinein und klingt neutraler, wie ein Sprecher, der liest, ohne zu spielen.
- 3Stelle das Tempo ein. Es reicht von 0.5× bis 2×: Diese Videos wirkten oft etwas flott, probier also, es leicht über 1× zu setzen.
- 4Schreibe Pausen dorthin, wo du einen dramatischen Moment willst: <#1.5#> zwischen zwei Sätzen fügt anderthalb Sekunden ein, bis höchstens 10 Sekunden.
- 5Beträge und Daten werden von allein gut gelesen; Abkürzungen schreibst du so, wie sie klingen sollen. Steht dort „SAM“, kann es anders herauskommen als gedacht; „Es A Em“ lässt keinen Zweifel.
- 6Erstelle zuerst ein kurzes Stück und hör es dir an. Passt der Ton, erstelle das ganze Skript, lade die MP3 herunter und zieh sie in den Schnitt.
Warum alte Computerstimmen so klangen
Es gab zwei Arten, Sprache zu erzeugen. Die einfache setzte die Laute aus Regeln zusammen, ohne echte Aufnahmen: Das ergibt den monotonen, fremden Klang der frühen Programme. Die aufwendigere, die zum Beispiel der Loquendo-Stimme Jorge zugrunde lag, schnitt stundenlange Aufnahmen eines Sprechers in winzige Stücke (Silben, Übergänge zwischen Lauten) und klebte für deinen Text passende Stücke aneinander. Sie heißt Unit-Selection-Synthese.
Hörbar blieben in beiden Fällen die Nähte, und die Satzmelodie kam aus festen Regeln, nicht aus dem Sinn des Satzes. Eine Frage und eine Aussage klangen fast gleich.
Eine KI-Stimme klebt nichts zusammen. Sie hat aus sehr vielen Stunden Sprache gelernt, wie jemand beim Lesen klingt, und erzeugt jeden Satz als Ganzes, passend zu dem, was er sagt: wo die Betonung liegt, wie das Ende einer Aussage fällt und das einer Frage steigt. Es gibt keine Nähte, und der Rhythmus ändert sich von Satz zu Satz.
Und Loquendo?
Loquendo, die Stimme, die in spanischsprachigen YouTube-Videos zum Meme wurde, spielt in Deutschland kaum eine Rolle. Kurz zur Einordnung: Loquendo war ein Unternehmen aus Turin, das 2011 an Nuance verkauft wurde und seither nicht mehr einzeln vertrieben wird. Die bekannten Stimmen (Jorge, Carmen) sind spanisch.
Wie lange ein vertontes Skript dauert und was es kostet
Für ein Video von zehn Minuten rechne mit rund 10.000 Zeichen Skript. Danach feinjustierst du über das Tempo, denn jede Stimme hat ihren eigenen Rhythmus, und der beeinflusst die Dauer stärker als der Text selbst.
Bei Voizum kosten 1.000 Zeichen 60 Credits, ohne Abo, und gekaufte Credits verfallen nicht. Mit der Google-Anmeldung bekommst du jeden Monat 600 Gratis-Credits, etwa 10 Minuten Audio: genug, um mehrere Stimmen mit dem Anfang deines Skripts zu testen, bevor du bezahlst.
Was du besser lässt
Eine KI-Stimme für deine Videos zu nutzen, auch kommerziell und in monetarisierten Videos, ist erlaubt. Nicht erlaubt ist, sich damit als eine andere Person auszugeben, oder illegale Inhalte.
- Stelle dein Video nicht als mit Microsoft SAM oder Loquendo gemacht dar und nutze ihre Logos nicht: Es sind Marken anderer Unternehmen.
- Versuche nicht, die Stimme eines bekannten YouTubers oder Sprechers nachzubilden: Eine echte Person ohne ihre Erlaubnis zu imitieren ist nicht erlaubt.
- Lade keine „SAM-TTS“-Installationsprogramme von beliebigen Seiten herunter: Denk an die Studie aus Singapur weiter oben.
Verwendete Quellen
- Microsoft Text-to-Speech-Stimmen (Wikipedia, englisch)
- Software Automatic Mouth (Wikipedia, englisch)
- Loquendo (Wikipedia, englisch)
- TIM Group: Abschluss des Verkaufs von Loquendo an Nuance (30.9.2011)
- ACTOR: ein mehrsprachiges Unit-Selection-Sprachsynthesesystem (Loquendo)
- NUS-Studie zu Schadsoftware in Raubkopien (Microsoft, 2017)