La reconnaissance vocale transforme une onde sonore continue en mots distincts, et elle le fait selon une suite d’étapes bien définie. Le signal du microphone est échantillonné en nombres, ces nombres deviennent un spectrogramme, un réseau de neurones associe ce spectrogramme au texte le plus probable, et une étape de mise en forme rend ce texte lisible. Tous les systèmes modernes — clavier de téléphone, outil de prise de notes en réunion, application de dictée — suivent une variante de cette chaîne.
La réponse courte à la question « comment sait-il ce que j’ai dit » : il ne le sait pas, il estime. Le modèle produit le texte le plus probable pour le son reçu, d’après ce qu’il a vu pendant l’entraînement. Ce seul fait explique l’essentiel de ce que l’on observe en pratique : pourquoi les expressions courantes sortent parfaitement, pourquoi le nom de famille d’un collègue non, et pourquoi une pause bruitée peut devenir une phrase que personne n’a dite.
Cet article parcourt la chaîne étape par étape, sans mathématiques et sans entrer dans le fonctionnement interne d’un fournisseur particulier.
Le son est une onde de pression. Le microphone la convertit en tension électrique, et un convertisseur analogique-numérique mesure cette tension des milliers de fois par seconde. Chaque mesure est un échantillon.
La musique est généralement enregistrée à 44 100 ou 48 000 échantillons par seconde. La reconnaissance vocale en demande rarement autant : les fréquences qui portent la parole se situent pour l’essentiel sous 8 kHz, donc la plupart des systèmes travaillent à 16 000 échantillons par seconde (16 kHz). L’article de recherche sur Whisper, par exemple, précise que tout l’audio est rééchantillonné à 16 000 Hz avant toute autre opération. L’audio téléphonique est souvent en 8 kHz, ce qui explique en partie pourquoi les enregistrements d’appels sont plus difficiles à transcrire : une partie du signal de parole n’a jamais été captée.
À ce stade, il n’y a ni mots, ni lettres, ni détection des silences. Il n’y a qu’une longue liste de nombres : une minute d’audio à 16 kHz en contient 960 000.
L’onde brute indique l’intensité du signal à chaque instant, mais ce qui distingue un son de parole d’un autre se trouve dans ses fréquences. Un « s » est une bouffée de bruit à haute fréquence ; une voyelle comme « a » présente des bandes d’énergie fortes et stables, plus bas.
Le système découpe donc l’audio en fenêtres courtes qui se chevauchent — environ 25 millisecondes chacune, décalées de 10 millisecondes — et mesure l’énergie de chaque fenêtre à chaque fréquence. Mises côte à côte, ces mesures forment un spectrogramme : le temps sur un axe, la fréquence sur l’autre, l’intensité rendue par la luminosité.
La plupart des systèmes utilisent un spectrogramme log-Mel. « Mel » signifie que les bandes de fréquence sont espacées selon la perception de la hauteur par l’oreille humaine (l’échelle de Mel) : serrées dans les graves, espacées dans les aigus. « Log » compresse l’intensité comme le fait l’oreille. Les modèles Whisper d’origine utilisent 80 canaux Mel sur des fenêtres de 25 ms avec un pas de 10 ms ; le modèle large-v3 est passé à 128. Dans les deux cas, une seconde d’audio devient environ 100 colonnes de nombres, une entrée bien plus compacte et informative que 16 000 échantillons bruts.
C’est là que les approches ont le plus changé au cours des quinze dernières années.
Pendant des décennies, les systèmes de reconnaissance étaient assemblés à partir de composants séparés. Un modèle acoustique estimait quels sons de la parole (phonèmes) étaient probables dans chaque trame, un dictionnaire de prononciation décrivait la composition de chaque mot en phonèmes, et un modèle de langage évaluait quelles suites de mots étaient plausibles. Des modèles de Markov cachés reliaient le tout dans le temps. Vers 2012, les réseaux de neurones profonds ont remplacé les anciens modèles de mélanges gaussiens au sein de cette chaîne et ont nettement réduit les taux d’erreur ; on date généralement ce tournant de l’article commun de Hinton et de ses collègues issus de quatre groupes de recherche.
Les systèmes modernes entraînent le plus souvent un seul réseau de neurones qui va directement du spectrogramme au texte. Trois architectures dominent :
| Approche | Comment elle aligne le son et le texte | Point fort typique |
|---|---|---|
| CTC (Graves et al., 2006) | Émet une étiquette ou un « blanc » pour chaque trame, puis fusionne les répétitions | Rapide, simple, adapté au streaming |
| Transducteur, RNN-T (Graves, 2012) | Décide à chaque pas s’il émet un jeton ou lit la trame suivante | Streaming à faible latence |
| Encodeur-décodeur à attention | Un encodeur lit tout le segment, un décodeur écrit le texte jeton par jeton | Grande précision sur des énoncés complets |
Whisper appartient à la troisième famille : un Transformer encodeur-décodeur qui lit des segments de 30 secondes et écrit du texte. La transcription en continu (streaming) — les mots qui s’affichent pendant que vous parlez encore — privilégie les deux premières, car elles peuvent produire un résultat avant la fin de la phrase.
La sortie n’est généralement pas composée de mots entiers mais de jetons sous-lexicaux (subword tokens) : des fragments comme « trans », « cript », « ion ». Cela permet au modèle d’écrire des mots qu’il n’a jamais vus en entier, et c’est pourquoi un nom de produit récent peut sortir sous la forme d’une combinaison de fragments plausible mais fausse.
Un modèle de bout en bout n’a pas de dictionnaire séparé, mais il a tout de même une idée précise des suites de mots probables, apprise à partir du texte associé à son audio d’entraînement. L’échelle compte : les modèles Whisper d’origine ont été entraînés sur 680 000 heures d’audio annoté, dont 117 000 heures couvrant 96 langues autres que l’anglais ; large-v3 a utilisé 1 million d’heures d’audio faiblement annoté et 4 millions d’heures d’audio pseudo-annoté. Les langues et les accents rares dans les données d’entraînement sont moins bien reconnus, pour la même raison que les noms rares.
Le réseau ne produit pas une réponse unique. À chaque pas, il donne une probabilité pour chaque jeton possible. Le décodage consiste à chercher la meilleure séquence globale : le décodage glouton prend à chaque fois le jeton le plus probable, tandis que la recherche en faisceau (beam search) garde plusieurs phrases candidates en parallèle et retient la meilleure une fois complète.
C’est aussi à cette étape qu’agissent les indications de vocabulaire. Beaucoup de moteurs acceptent une liste de termes attendus ou un court texte d’amorce ; le guide d’OpenAI sur le prompting de Whisper, par exemple, montre une amorce qui énumère des noms de produits et d’entreprises pour orienter l’orthographe. Une indication déplace les probabilités vers ces mots, mais ne peut pas sauver un audio que le modèle n’entend réellement pas.
La sortie brute de la reconnaissance ressemble souvent à « donc la réunion est à quinze heures trente le cinq mars ». La transformer en « Donc la réunion est à 15 h 30 le 5 mars. » est une tâche distincte :
Certains modèles, dont Whisper, apprennent à produire directement du texte ponctué parce que leurs transcriptions d’entraînement l’étaient. D’autres font passer un modèle dédié après la reconnaissance. Dans les deux cas, les erreurs de mise en forme sont d’une autre nature que les erreurs de reconnaissance : les mots peuvent être justes et le texte rester difficile à lire.
Connaître la chaîne rend les erreurs typiques prévisibles :
La précision est généralement exprimée par le taux d’erreur sur les mots (WER, word error rate) : substitutions, suppressions et insertions divisées par le nombre de mots réellement prononcés. Il est utile pour comparer des systèmes sur le même audio, mais les chiffres de fournisseurs différents ne sont pas directement comparables : les enregistrements de test diffèrent, tout comme les règles de normalisation qui décident si « 15 h 30 » et « quinze heures trente » comptent comme identiques.
Pour un usage quotidien, quelques conclusions pratiques découlent de cette chaîne :
Dans Speak-Y, la dictée fonctionne dans plus de 67 langues avec ponctuation automatique, et le mode réunion enregistre les appels en local sans qu’aucun bot ne les rejoigne, transcrit par locuteur et conserve par défaut les transcriptions sur votre appareil — les compromis de l’enregistrement sans bot sont détaillés dans enregistrer une réunion sans bot. Une fois les transcriptions disponibles, la question suivante est ce que vous en faites : un serveur MCP local permet à des assistants IA comme Claude ou Cursor de les rechercher et de les lire, ce qu’explique depuis la base l’article qu’est-ce qu’un serveur MCP.
Un microphone transforme la pression de l’air en une suite de nombres, en général 16 000 échantillons par seconde pour la reconnaissance vocale. Le logiciel découpe ce signal en tranches courtes qui se chevauchent et en tire un spectrogramme, une image des fréquences les plus fortes à chaque instant. Un réseau de neurones lit ce spectrogramme et prédit la suite de mots ou de fragments de mots la plus probable, puis une dernière étape ajoute la ponctuation, les majuscules et la mise en forme des nombres.
Un spectrogramme montre comment l’énergie d’un son se répartit entre les fréquences au fil du temps. Les systèmes de reconnaissance utilisent en général un spectrogramme log-Mel, dont les bandes de fréquence sont espacées comme les perçoit l’oreille humaine. Whisper d’OpenAI, par exemple, calcule un spectrogramme log-Mel à 80 canaux sur des fenêtres de 25 millisecondes avec un pas de 10 millisecondes, ce qui donne au modèle 100 trames de caractéristiques par seconde d’audio.
Le modèle choisit le texte le plus probable pour le son qu’il entend, et cette probabilité vient des données d’entraînement. Un nom de famille rare ou un nom de produit récent y figurait peu ou pas du tout, si bien qu’un mot courant qui sonne de la même façon l’emporte. Les indications de vocabulaire aident : beaucoup de moteurs acceptent une liste de termes attendus ou un court texte d’amorce qui oriente la sortie vers ces orthographes.
Oui. Les modèles qui génèrent le texte jeton par jeton peuvent produire des phrases fluides pendant un silence ou du bruit. Une étude présentée à FAccT en 2024, Careless Whisper, a constaté qu’environ 1 % des transcriptions Whisper de son échantillon contenaient des phrases entières hallucinées. Supprimer les silences avant la reconnaissance et relire les transcriptions importantes réduit ce risque.
Le taux d’erreur sur les mots (word error rate, WER) est la mesure de précision de référence : substitutions, suppressions et insertions, divisées par le nombre de mots de la transcription de référence. Plus il est bas, mieux c’est, et il peut dépasser 100 % quand un système insère beaucoup de mots en trop. Les valeurs de WER ne sont comparables que si elles proviennent du même audio de test et des mêmes règles de normalisation du texte.