Wie funktioniert Spracherkennung? Vom Schall zum Text

Spracherkennung verwandelt eine kontinuierliche Schallwelle in einzelne Wörter, und zwar in einer festen Abfolge von Schritten. Das Mikrofonsignal wird in Zahlen abgetastet, die Zahlen werden zu einem Spektrogramm, ein neuronales Netz ordnet dem Spektrogramm wahrscheinlichen Text zu, und ein Formatierungsschritt macht diesen Text lesbar. Jedes moderne System – die Tastatur im Smartphone, ein Meeting-Notetaker, eine Diktier-App – folgt einer Variante dieser Pipeline.

Die kurze Antwort auf die Frage „Woher weiß es, was ich gesagt habe?“ lautet: Es weiß es nicht, es schätzt. Das Modell gibt den wahrscheinlichsten Text für den empfangenen Klang aus, auf Grundlage dessen, was es im Training gesehen hat. Diese eine Tatsache erklärt das meiste, was Ihnen im Alltag auffällt: warum gängige Wendungen perfekt herauskommen, der Nachname einer Kollegin aber nicht, und warum eine verrauschte Pause zu einem Satz werden kann, den niemand gesagt hat.

Dieser Artikel geht die Pipeline Schritt für Schritt durch, ohne Mathematik und ohne die Interna eines bestimmten Anbieters.

Schritt 1: Wie macht ein Mikrofon aus Schall Zahlen?

Schall ist eine Druckwelle. Das Mikrofon wandelt sie in eine Spannung um, und ein Analog-Digital-Wandler misst diese Spannung viele tausend Mal pro Sekunde. Jede Messung ist ein Abtastwert (Sample).

Musik wird meist mit 44.100 oder 48.000 Abtastwerten pro Sekunde aufgenommen. Die Spracherkennung braucht selten so viel: Die Frequenzen, die Sprache tragen, liegen überwiegend unter 8 kHz, deshalb arbeiten die meisten Erkenner mit 16.000 Abtastwerten pro Sekunde (16 kHz). Im Whisper-Paper heißt es zum Beispiel, dass jedes Audio vor allem anderen auf 16.000 Hz umgerechnet wird. Telefonaudio hat oft nur 8 kHz – ein Grund, warum Telefonaufnahmen schwerer zu transkribieren sind: Ein Teil des Sprachsignals wurde nie erfasst.

In diesem Stadium gibt es keine Wörter, keine Buchstaben und keine Stilleerkennung. Es gibt nur eine lange Liste von Zahlen: Eine Minute Audio mit 16 kHz sind 960.000 davon.

Schritt 2: Was ist ein Spektrogramm, und warum nicht die rohe Wellenform?

Die rohe Wellenform sagt, wie laut das Signal in jedem Augenblick ist. Die Information, die einen Sprachlaut vom anderen unterscheidet, steckt aber in seinen Frequenzen. Ein „s“ ist ein Stoß hochfrequenten Rauschens; ein Vokal wie „a“ hat kräftige, stabile Energiebänder weiter unten.

Deshalb schneidet der Erkenner das Audio in kurze, überlappende Fenster – typischerweise etwa 25 Millisekunden lang, jeweils um 10 Millisekunden verschoben – und misst, wie viel Energie jedes Fenster bei jeder Frequenz hat. Nebeneinandergelegt ergeben diese Messungen ein Spektrogramm: Zeit auf der einen Achse, Frequenz auf der anderen, Lautstärke als Helligkeit.

Die meisten Systeme verwenden ein Log-Mel-Spektrogramm. „Mel“ bedeutet, dass die Frequenzbänder so verteilt sind, wie das menschliche Gehör Tonhöhen wahrnimmt – dicht bei tiefen Frequenzen, weit auseinander bei hohen. „Log“ staucht die Lautstärke so, wie es das Ohr tut. Die ursprünglichen Whisper-Modelle nutzen 80 Mel-Kanäle auf 25-ms-Fenstern mit 10 ms Versatz; das Modell large-v3 ist auf 128 gewechselt. So oder so wird eine Sekunde Audio zu etwa 100 Spalten mit Zahlen – eine weit kompaktere und aussagekräftigere Eingabe als 16.000 rohe Abtastwerte.

Schritt 3: Wie ordnet das Modell Klängen Wörter zu?

Hier haben sich die Ansätze in den letzten fünfzehn Jahren am stärksten verändert.

Die klassische Pipeline: akustisches Modell, Aussprachewörterbuch, Sprachmodell

Jahrzehntelang bestanden Erkenner aus getrennten Teilen. Ein akustisches Modell schätzte, welche Sprachlaute (Phoneme) in jedem Rahmen wahrscheinlich waren, ein Aussprachewörterbuch legte fest, wie jedes Wort aus Phonemen aufgebaut ist, und ein Sprachmodell bewertete, welche Wortfolgen plausibel sind. Hidden-Markov-Modelle verbanden das Ganze über die Zeit. Um 2012 ersetzten tiefe neuronale Netze die älteren Gaußschen Mischmodelle innerhalb dieser Pipeline und senkten die Fehlerraten deutlich – als Wendepunkt gilt meist das gemeinsame Paper von Hinton und Kollegen aus vier Forschungsgruppen.

End-to-End-Modelle

Moderne Systeme trainieren meist ein einziges neuronales Netz, das direkt vom Spektrogramm zum Text geht. Drei Architekturen dominieren:

Ansatz Wie Klang und Text zugeordnet werden Typische Stärke
CTC (Graves et al., 2006) Gibt für jeden Rahmen ein Label oder ein „Blank“ aus und fasst Wiederholungen zusammen Schnell, einfach, gut für Streaming
Transducer, RNN-T (Graves, 2012) Entscheidet bei jedem Schritt, ob ein Token ausgegeben oder der nächste Rahmen gelesen wird Streaming mit geringer Latenz
Attention-Encoder-Decoder Ein Encoder liest das ganze Segment, ein Decoder schreibt den Text Token für Token Hohe Genauigkeit bei vollständigen Äußerungen

Whisper ist ein Beispiel für die dritte Art: ein Encoder-Decoder-Transformer, der 30-Sekunden-Abschnitte liest und Text schreibt. Die Streaming-Transkription – Wörter erscheinen, während Sie noch sprechen – begünstigt die ersten beiden, weil sie schon Ausgabe liefern können, bevor der Satz zu Ende ist.

Die Ausgabe besteht meist nicht aus ganzen Wörtern, sondern aus Subword-Tokens: Teilen wie „trans“, „krip“, „tion“. So kann ein Modell auch Wörter schreiben, die es nie als Ganzes gesehen hat – und deshalb kann ein neuer Produktname als plausible, aber falsche Kombination von Bruchstücken herauskommen.

Woher das Sprachwissen kommt

Ein End-to-End-Modell hat kein separates Wörterbuch, trägt aber trotzdem ein starkes Gespür dafür in sich, welche Wortfolgen wahrscheinlich sind – gelernt aus den Texten, die zu seinem Trainingsaudio gehören. Dabei zählt die Menge: Die ursprünglichen Whisper-Modelle wurden mit 680.000 Stunden gelabeltem Audio trainiert, davon 117.000 Stunden in 96 anderen Sprachen als Englisch; large-v3 nutzte 1 Million Stunden schwach gelabeltes Audio plus 4 Millionen Stunden pseudo-gelabeltes Audio. Sprachen und Akzente, die in den Trainingsdaten selten sind, werden weniger genau erkannt – aus demselben Grund wie seltene Namen.

Schritt 4: Decoding – die Wahl des endgültigen Texts

Das Netz gibt nicht eine einzige Antwort aus. Bei jedem Schritt liefert es eine Wahrscheinlichkeit für jedes mögliche Token. Decoding ist die Suche nach der insgesamt besten Folge: Greedy Decoding nimmt jedes Mal das wahrscheinlichste Token, während die Beam Search (Strahlsuche) mehrere Kandidatensätze parallel verfolgt und am Ende den besten vollständigen auswählt.

Hier wirken auch Vokabelhinweise. Viele Engines akzeptieren eine Liste erwarteter Begriffe oder einen kurzen Text-Prompt; OpenAIs Prompting-Leitfaden für Whisper zeigt etwa einen Prompt, der Produkt- und Firmennamen aufzählt, um die Schreibweise zu steuern. Ein Hinweis verschiebt die Wahrscheinlichkeiten in Richtung dieser Wörter, kann aber kein Audio retten, das das Modell tatsächlich nicht hören kann.

Schritt 5: Zeichensetzung und Formatierung

Die rohe Ausgabe der Erkennung sieht oft so aus: „also das meeting ist um fünfzehn uhr dreißig am fünften märz“. Daraus „Also, das Meeting ist um 15:30 Uhr am 5. März.“ zu machen, ist eine eigene Aufgabe:

Manche Modelle, darunter Whisper, lernen, direkt Text mit Satzzeichen auszugeben, weil ihre Trainingstranskripte Satzzeichen enthielten. Andere lassen nach der Erkennung ein eigenes Modell laufen. So oder so sind Formatierungsfehler eine andere Fehlerklasse als Erkennungsfehler: Die Wörter können stimmen und der Text trotzdem schwer lesbar sein.

Warum macht Spracherkennung Fehler?

Wer die Pipeline kennt, kann die typischen Fehler vorhersagen:

  1. Seltene Wörter verlieren gegen häufige. Ein Nachname, ein internes Projektkürzel oder ein brandneues Tool klingt wie etwas Häufigeres, und das Häufigere gewinnt. Vokabelhinweise sind die direkte Abhilfe.
  2. Fehlendes Signal lässt sich nicht zurückholen. Ein Laptop-Mikrofon am anderen Ende des Raums, Telefonaudio mit 8 kHz oder zwei Personen, die gleichzeitig sprechen, entfernen Information, bevor das Modell sie sieht.
  3. Generative Modelle können halluzinieren. Ein Decoder, der Text Token für Token schreibt, erzeugt bei Stille oder Rauschen manchmal flüssige Sätze. Das FAccT-Paper Careless Whisper von 2024 fand ganze erfundene Phrasen oder Sätze in rund 1 % der untersuchten Whisper-Transkripte. Stille vor der Erkennung zu entfernen verringert das.
  4. Wer gesprochen hat, ist ein eigenes Problem. Die Erkennung liefert Wörter; sie Sprechern zuzuordnen ist Sprecherdiarisierung (Speaker Diarization), ein anderes Modell mit eigenen Fehlern.

Die Genauigkeit wird meist als Wortfehlerrate (Word Error Rate, WER) angegeben: Ersetzungen, Auslassungen und Einfügungen, geteilt durch die Zahl der tatsächlich gesprochenen Wörter. Sie eignet sich, um Systeme auf demselben Audio zu vergleichen, aber Werte verschiedener Anbieter sind nicht direkt vergleichbar: Die Testaufnahmen unterscheiden sich, und ebenso die Normalisierungsregeln, die entscheiden, ob „15:30“ und „fünfzehn Uhr dreißig“ als dasselbe zählen.

Was das für die Wahl eines Tools bedeutet

Für den Alltag ergeben sich aus der Pipeline einige praktische Schlüsse:

In Speak-Y funktioniert das Diktieren in über 67 Sprachen mit automatischer Zeichensetzung, und der Meeting-Modus zeichnet Calls lokal auf, ohne dass ein Bot beitritt, transkribiert nach Sprechern getrennt und speichert die Transkripte standardmäßig auf Ihrem Gerät – die Vor- und Nachteile der Aufnahme ohne Bot beschreibt der Artikel über Meetings aufzeichnen ohne Bot. Sobald Transkripte vorliegen, stellt sich die nächste Frage: Was machen Sie damit? Ein lokaler MCP-Server lässt KI-Assistenten wie Claude oder Cursor sie durchsuchen und lesen; von Grund auf erklärt wird das in Was ist ein MCP-Server.

FAQ

Wie funktioniert Spracherkennung, kurz zusammengefasst?

Ein Mikrofon wandelt Luftdruck in eine Zahlenfolge um, für die Spracherkennung meist 16.000 Abtastwerte pro Sekunde. Die Software zerlegt dieses Signal in kurze, überlappende Abschnitte und macht daraus ein Spektrogramm – ein Bild davon, welche Frequenzen in jedem Moment laut sind. Ein neuronales Netz liest das Spektrogramm und sagt die wahrscheinlichste Folge von Wörtern oder Wortteilen voraus; ein letzter Schritt ergänzt Satzzeichen, Groß- und Kleinschreibung und die Schreibweise von Zahlen.

Was ist ein Spektrogramm und warum nutzt die Spracherkennung es?

Ein Spektrogramm zeigt, wie sich die Energie eines Klangs über die Zeit auf die Frequenzen verteilt. Spracherkenner verwenden meist ein Log-Mel-Spektrogramm, dessen Frequenzbänder so verteilt sind, wie das menschliche Gehör Tonhöhen wahrnimmt. OpenAIs Whisper berechnet zum Beispiel ein Log-Mel-Spektrogramm mit 80 Kanälen auf 25-Millisekunden-Fenstern mit 10 Millisekunden Versatz – das ergibt 100 Merkmalsrahmen pro Sekunde Audio.

Warum erkennt Spracherkennung Namen und Fachbegriffe falsch?

Das Modell wählt den wahrscheinlichsten Text für den gehörten Klang, und die Wahrscheinlichkeit stammt aus den Trainingsdaten. Ein seltener Nachname oder ein neuer Produktname kam darin kaum oder gar nicht vor, also gewinnt ein häufiges, ähnlich klingendes Wort. Vokabelhinweise helfen: Viele Engines akzeptieren eine Liste erwarteter Begriffe oder einen kurzen Text-Prompt, der die Ausgabe in Richtung dieser Schreibweisen lenkt.

Kann Spracherkennung Wörter erfinden, die nie gesagt wurden?

Ja. Modelle, die Text Token für Token erzeugen, können bei Stille oder Rauschen flüssige Sätze produzieren. Die FAccT-Studie Careless Whisper von 2024 fand in rund 1 % der untersuchten Whisper-Transkripte ganze halluzinierte Phrasen oder Sätze. Stille vor der Erkennung herauszuschneiden und wichtige Transkripte gegenzulesen verringert das Risiko.

Was ist die Wortfehlerrate?

Die Wortfehlerrate (Word Error Rate, WER) ist die übliche Genauigkeitsmetrik: Ersetzungen plus Auslassungen plus Einfügungen, geteilt durch die Zahl der Wörter im Referenztranskript. Niedriger ist besser, und der Wert kann über 100 % liegen, wenn ein System viele zusätzliche Wörter einfügt. WER-Werte sind nur vergleichbar, wenn sie auf denselben Testaufnahmen und denselben Regeln zur Textnormalisierung beruhen.