Tous les grands outils de développement assistés par IA ont livré la saisie
vocale au cours de l’année écoulée : la première question n’est donc plus de
savoir si vous pouvez dicter un prompt. Claude Code a /voice, Cursor a la
saisie vocale à touche maintenue dans sa fenêtre d’agent, et VS Code a la dictée
intégrée au chat, à l’éditeur et au terminal.
La question qui reste est plus étroite et plus utile : chacun de ces outils couvre l’unique case où vous parlez au modèle, et aucun ne couvre les vingt autres endroits où un développeur tape de la prose toute la journée. Cet écart est tout l’argument en faveur d’un outil de dictée système, et c’est aussi pourquoi l’effet intéressant du voice coding n’est pas la vitesse — c’est que les prompts dictés sortent trois fois plus longs que les prompts tapés, et cette longueur supplémentaire est du contexte qui manquait au modèle.
Les faits concernant les autres outils ci-dessous ont été vérifiés le 17 août 2026.
| Outil | Comment on le déclenche | Où cela fonctionne | Où va l’audio |
|---|---|---|---|
| Claude Code | /voice, puis maintenir Space (ou appuyer une fois pour démarrer et une seconde fois pour envoyer) |
Invite de la CLI et vue agent ; aussi l’extension VS Code | Les serveurs d’Anthropic |
| Cursor | Maintenir Ctrl+M dans la fenêtre Agents |
Zone de prompt de l’agent et du chat | Les serveurs de Cursor |
| VS Code | ⌘I dans le chat, ⌥⌘V dans l’éditeur |
Chat, fenêtre Agents, éditeurs et terminaux | Sur votre appareil par défaut |
Trois détails méritent d’être sortis de ce tableau.
La dictée de Claude Code est réglée pour ce métier. Des termes comme
regex, OAuth, JSON et localhost sont reconnus comme des termes, et le
nom de votre projet courant ainsi que celui de votre branche git sont transmis
automatiquement comme indices de reconnaissance — c’est pour cela que la branche
sur laquelle vous êtes ressort correctement orthographiée plutôt que
phonétiquement. La transcription ne consomme pas de tokens et ne compte pas dans
les limites affichées par /usage.
C’est aussi la plus verrouillée. /voice exige un compte Claude.ai : la
fonction est indisponible quand Claude Code tourne sur une clé API Anthropic,
Amazon Bedrock, l’Agent Platform de Google Cloud ou Microsoft Foundry, et les
organisations dont la conformité HIPAA est activée l’ont désactivée par
politique interne. Elle a besoin d’un micro local, elle ne fonctionne donc ni en
SSH, ni dans Claude Code sur le web, ni dans VS Code Remote, les Dev Containers
et Codespaces.
VS Code fait exception sur la confidentialité. Sa dictée intégrée traite l’audio du micro sur votre appareil et n’a besoin d’aucune connexion internet une fois le modèle téléchargé. La fonction est marquée expérimentale, et elle est indisponible sur VS Code for the Web, les Mac Intel, les systèmes 32 bits et Arm32 et les distributions Linux basées sur musl comme Alpine — l’extension Speech couvre ces cas.
Le chiffre de vitesse est réel mais survendu. L’étude de Stanford que l’on cite — Ruan et al., 2016 — mesurait la saisie de texte en anglais sur un iPhone 6 Plus et trouvait la parole 2,93 fois plus rapide que le clavier à l’écran, 153 mots par minute contre 52. Un développeur sur un clavier mécanique ne tape pas à 52 mots par minute : le multiplicateur honnête pour ce public est donc plus petit.
L’effet qui compte vraiment est ce qui arrive à la longueur du prompt. Taper impose un coût à chaque phrase supplémentaire, et la première chose que l’on coupe est le contexte, parce que le contexte paraît optionnel alors que la demande, elle, ne l’est pas. Le prompt tapé est donc « corrige le middleware d’auth, il renvoie 401 au refresh », et le prompt dicté, c’est cela plus les deux choses que vous avez déjà essayées, le fichier que vous soupçonnez, le message d’erreur mot pour mot, et la contrainte que le helper de token ne doit pas changer parce que trois autres services l’appellent.
Cette différence n’est pas de la politesse. Chacune de ces propositions supprime une branche que le modèle devrait sinon deviner, et deviner de travers est ce qui produit le diff que vous jetez. La même étude a trouvé que la parole avait environ deux fois moins d’erreurs pendant la saisie — 5,30 % contre 11,22 % de corrections — ce qui est une façon de dire que penser à voix haute n’est pas plus bruyant que taper, c’est simplement plus long.
Il y a un effet de second ordre qui mérite d’être nommé. Décrire un bug à voix haute vous oblige à l’énoncer en phrases complètes, et environ une fois sur cinq vous le résolvez en cours de phrase, avant même que le modèle ait la parole. C’est du débogage au canard en plastique, avec transcription.
Les trois implémentations mettent le texte au même endroit : la case où vous adressez le prompt au modèle. Cette case représente une petite fraction de la prose qu’un développeur écrit.
Il y a aussi une contrainte de méthode de travail qui prend les gens de court : aucune des options intégrées ne fonctionne en SSH ou dans un dev container, parce que le micro est sur votre machine et que l’outil tourne ailleurs. Si vous développez sur un hôte distant — de plus en plus courant — la saisie vocale de l’assistant est indisponible précisément là où vous passez la journée, alors qu’une application de dictée qui tourne sur votre portable continue de fonctionner, parce qu’elle écrit dans la fenêtre du terminal comme le ferait un clavier.
Un outil système, c’est un raccourci unique qui insère du texte là où se trouve le curseur : le même geste fonctionne dans la zone d’agent de Cursor, dans un champ de saisie du navigateur, dans un terminal et dans Slack. La contrepartie, c’est un abonnement de plus et une chose de plus à apprendre, et pour quelqu’un qui ne dicte jamais que dans un seul panneau d’agent, l’option intégrée suffit vraiment. Vérifié le 17 août 2026 :
| Outil | Formule gratuite | Payant | À noter |
|---|---|---|---|
| Wispr Flow | 2 000 mots/semaine sur ordinateur, 1 000 sur iPhone | 12 $/utilisateur/mois en annuel, 15 $ au mois | Mac, Windows, iOS, Android |
| superwhisper | Formule gratuite avec plus de 100 langues et petits modèles | Pro à partir de 8 $/mois en annuel | Modèles locaux, au mieux sur Apple Silicon |
| Aqua Voice | 1 000 mots, une seule fois | Pro 8 $/mois ; Max 24 $/mois ajoute le mode temps réel et les commandes vocales | Cloud uniquement |
| Speak-Y | 2 000 mots/semaine, sans carte bancaire | Pro et Pro+ | Plus de 67 langues, mode réunion sans bot, serveur MCP local gratuit |
La dimension sur laquelle comparer n’est pas le prix mais la destination de l’audio. Un outil qui transcrit sur votre machine et un outil qui envoie chaque dictée à l’API d’un éditeur sont le même produit vus de l’extérieur, et deux produits très différents si vous dictez à propos de clients, d’identifiants ou de travaux non publiés.
Une liste honnête, parce que prétendre le contraire est la raison pour laquelle les gens abandonnent au bout d’une semaine.
handleAuthRefresh, --no-verify, une regex,
un bloc JSON, un chemin de fichier. Les dicter puis les corriger prend plus de
temps que les taper. Tapez les symboles, dites les phrases.Le schéma qui survit au contact d’une journée de travail est la saisie mixte :
dire le paragraphe, taper les identifiants, et garder les deux mains sur le
clavier tout du long. Claude Code est explicitement construit pour cela — la
transcription est insérée à la position de votre curseur et le curseur reste à
la fin, ce qui vous permet de maintenir Space, de dire une proposition, de
taper un nom de fonction, et de maintenir Space à nouveau.
Speak-Y est la moitié système du dispositif : appuyez sur un raccourci, parlez,
et le texte apparaît là où le curseur se trouve déjà — Cursor, VS Code,
JetBrains, un terminal, un navigateur, Slack. Il ne remplace pas /voice dans
Claude Code ; il couvre la description de pull request et le rapport de bug que
/voice ne voit jamais. La ponctuation est automatique et plus de 67 langues
fonctionnent sans rien changer, ce qui compte si vous pensez dans une langue et
que votre dépôt est dans une autre.
La formule gratuite, c’est 2 000 mots par semaine sans carte bancaire, sur macOS 14.0 et plus récent et Windows 10 et plus récent, plus un clavier iOS compris dans le même abonnement. Le guide d’installation couvre les autorisations et le choix du raccourci.
Il y a une seconde connexion entre la dictée et les assistants IA, facile à manquer. Le serveur MCP intégré de Speak-Y est gratuit dans toutes les formules, et il permet à Claude Code, Cursor ou ChatGPT de lire vos enregistrements et vos transcriptions de réunion en local — le contexte que vous dictez n’est donc pas le seul dont dispose l’agent. La décision que votre équipe a prise sur le flux d’authentification est dans une transcription que l’assistant peut chercher, plutôt que dans votre souvenir d’un appel.
Si votre travail tient plus des réunions que des prompts, relier les transcriptions de réunion au code dans Cursor est l’étape suivante, et vingt prompts qui fonctionnent via MCP couvre ce qu’il faut réellement demander une fois la connexion en place.
Oui. Lancez /voice dans la CLI pour activer la dictée, puis maintenez Space pendant que vous parlez, ou appuyez une fois pour démarrer et une seconde fois pour envoyer. Il faut Claude Code v2.1.69 ou plus récent et un compte Claude.ai — la fonction est indisponible quand Claude Code s’authentifie par clé API, Amazon Bedrock, Google Cloud ou Microsoft Foundry. L’audio part vers les serveurs d’Anthropic plutôt que d’être transcrit sur votre machine, et il ne consomme pas de tokens ni ne compte dans vos limites d’usage.
Oui. Cursor a ajouté la saisie vocale intégrée dans la version 2.0 le 29 octobre 2025, et la version 3.1 du 13 avril 2026 l’a améliorée dans la fenêtre Agents : maintenez Ctrl+M pour parler, avec une forme d’onde, un minuteur et des boutons annuler ou confirmer. L’outil enregistre le clip entier puis le transcrit en un seul lot. Le texte arrive dans la zone de prompt de l’agent — pour l’éditeur, Cmd+K ou le terminal, il vous faut encore un outil de dictée système.
Parce que la longueur ne coûte plus rien. La parole va environ trois fois plus vite que la frappe : la contrainte qui pousse à écrire « corrige le bug d’auth » au lieu de trois phrases de contexte disparaît. Ces phrases supplémentaires sont exactement le contexte qui manque au modèle — les fichiers que vous avez déjà écartés, ce que disait vraiment l’erreur, ce que vous ne voulez pas voir changer.
Cela dépend de l’outil, et cela vaut la peine de vérifier avant de dicter quoi que ce soit de sensible. La dictée intégrée de VS Code traite l’audio du micro sur votre appareil et n’a plus besoin de connexion une fois le modèle téléchargé. Le /voice de Claude Code envoie l’audio aux serveurs d’Anthropic. Cursor transcrit côté serveur. Parmi les applications tierces, superwhisper fait tourner des modèles locaux sur Apple Silicon, tandis qu’Aqua Voice fonctionne dans le cloud.
Dans tout ce qui dépend des caractères exacts. Identifiants, expressions régulières, options de shell, JSON et chemins de fichiers ressortent faux assez souvent pour que les corriger coûte plus cher que les taper. Dictez la prose — le prompt, le commentaire de revue, le message de commit, le rapport de bug — et tapez les symboles.