Voice coding : dicter ses prompts à Claude Code et Cursor

Tous les grands outils de développement assistés par IA ont livré la saisie vocale au cours de l’année écoulée : la première question n’est donc plus de savoir si vous pouvez dicter un prompt. Claude Code a /voice, Cursor a la saisie vocale à touche maintenue dans sa fenêtre d’agent, et VS Code a la dictée intégrée au chat, à l’éditeur et au terminal.

La question qui reste est plus étroite et plus utile : chacun de ces outils couvre l’unique case où vous parlez au modèle, et aucun ne couvre les vingt autres endroits où un développeur tape de la prose toute la journée. Cet écart est tout l’argument en faveur d’un outil de dictée système, et c’est aussi pourquoi l’effet intéressant du voice coding n’est pas la vitesse — c’est que les prompts dictés sortent trois fois plus longs que les prompts tapés, et cette longueur supplémentaire est du contexte qui manquait au modèle.

Les faits concernant les autres outils ci-dessous ont été vérifiés le 17 août 2026.

Ce que chaque assistant fait déjà

Outil Comment on le déclenche Où cela fonctionne Où va l’audio
Claude Code /voice, puis maintenir Space (ou appuyer une fois pour démarrer et une seconde fois pour envoyer) Invite de la CLI et vue agent ; aussi l’extension VS Code Les serveurs d’Anthropic
Cursor Maintenir Ctrl+M dans la fenêtre Agents Zone de prompt de l’agent et du chat Les serveurs de Cursor
VS Code ⌘I dans le chat, ⌥⌘V dans l’éditeur Chat, fenêtre Agents, éditeurs et terminaux Sur votre appareil par défaut

Trois détails méritent d’être sortis de ce tableau.

La dictée de Claude Code est réglée pour ce métier. Des termes comme regex, OAuth, JSON et localhost sont reconnus comme des termes, et le nom de votre projet courant ainsi que celui de votre branche git sont transmis automatiquement comme indices de reconnaissance — c’est pour cela que la branche sur laquelle vous êtes ressort correctement orthographiée plutôt que phonétiquement. La transcription ne consomme pas de tokens et ne compte pas dans les limites affichées par /usage.

C’est aussi la plus verrouillée. /voice exige un compte Claude.ai : la fonction est indisponible quand Claude Code tourne sur une clé API Anthropic, Amazon Bedrock, l’Agent Platform de Google Cloud ou Microsoft Foundry, et les organisations dont la conformité HIPAA est activée l’ont désactivée par politique interne. Elle a besoin d’un micro local, elle ne fonctionne donc ni en SSH, ni dans Claude Code sur le web, ni dans VS Code Remote, les Dev Containers et Codespaces.

VS Code fait exception sur la confidentialité. Sa dictée intégrée traite l’audio du micro sur votre appareil et n’a besoin d’aucune connexion internet une fois le modèle téléchargé. La fonction est marquée expérimentale, et elle est indisponible sur VS Code for the Web, les Mac Intel, les systèmes 32 bits et Arm32 et les distributions Linux basées sur musl comme Alpine — l’extension Speech couvre ces cas.

Pourquoi un prompt dicté porte plus de contexte

Le chiffre de vitesse est réel mais survendu. L’étude de Stanford que l’on cite — Ruan et al., 2016 — mesurait la saisie de texte en anglais sur un iPhone 6 Plus et trouvait la parole 2,93 fois plus rapide que le clavier à l’écran, 153 mots par minute contre 52. Un développeur sur un clavier mécanique ne tape pas à 52 mots par minute : le multiplicateur honnête pour ce public est donc plus petit.

L’effet qui compte vraiment est ce qui arrive à la longueur du prompt. Taper impose un coût à chaque phrase supplémentaire, et la première chose que l’on coupe est le contexte, parce que le contexte paraît optionnel alors que la demande, elle, ne l’est pas. Le prompt tapé est donc « corrige le middleware d’auth, il renvoie 401 au refresh », et le prompt dicté, c’est cela plus les deux choses que vous avez déjà essayées, le fichier que vous soupçonnez, le message d’erreur mot pour mot, et la contrainte que le helper de token ne doit pas changer parce que trois autres services l’appellent.

Cette différence n’est pas de la politesse. Chacune de ces propositions supprime une branche que le modèle devrait sinon deviner, et deviner de travers est ce qui produit le diff que vous jetez. La même étude a trouvé que la parole avait environ deux fois moins d’erreurs pendant la saisie — 5,30 % contre 11,22 % de corrections — ce qui est une façon de dire que penser à voix haute n’est pas plus bruyant que taper, c’est simplement plus long.

Il y a un effet de second ordre qui mérite d’être nommé. Décrire un bug à voix haute vous oblige à l’énoncer en phrases complètes, et environ une fois sur cinq vous le résolvez en cours de phrase, avant même que le modèle ait la parole. C’est du débogage au canard en plastique, avec transcription.

Où s’arrête la saisie vocale intégrée

Les trois implémentations mettent le texte au même endroit : la case où vous adressez le prompt au modèle. Cette case représente une petite fraction de la prose qu’un développeur écrit.

Il y a aussi une contrainte de méthode de travail qui prend les gens de court : aucune des options intégrées ne fonctionne en SSH ou dans un dev container, parce que le micro est sur votre machine et que l’outil tourne ailleurs. Si vous développez sur un hôte distant — de plus en plus courant — la saisie vocale de l’assistant est indisponible précisément là où vous passez la journée, alors qu’une application de dictée qui tourne sur votre portable continue de fonctionner, parce qu’elle écrit dans la fenêtre du terminal comme le ferait un clavier.

Ce qu’un outil de dictée système apporte, et ce qu’il coûte

Un outil système, c’est un raccourci unique qui insère du texte là où se trouve le curseur : le même geste fonctionne dans la zone d’agent de Cursor, dans un champ de saisie du navigateur, dans un terminal et dans Slack. La contrepartie, c’est un abonnement de plus et une chose de plus à apprendre, et pour quelqu’un qui ne dicte jamais que dans un seul panneau d’agent, l’option intégrée suffit vraiment. Vérifié le 17 août 2026 :

Outil Formule gratuite Payant À noter
Wispr Flow 2 000 mots/semaine sur ordinateur, 1 000 sur iPhone 12 $/utilisateur/mois en annuel, 15 $ au mois Mac, Windows, iOS, Android
superwhisper Formule gratuite avec plus de 100 langues et petits modèles Pro à partir de 8 $/mois en annuel Modèles locaux, au mieux sur Apple Silicon
Aqua Voice 1 000 mots, une seule fois Pro 8 $/mois ; Max 24 $/mois ajoute le mode temps réel et les commandes vocales Cloud uniquement
Speak-Y 2 000 mots/semaine, sans carte bancaire Pro et Pro+ Plus de 67 langues, mode réunion sans bot, serveur MCP local gratuit

La dimension sur laquelle comparer n’est pas le prix mais la destination de l’audio. Un outil qui transcrit sur votre machine et un outil qui envoie chaque dictée à l’API d’un éditeur sont le même produit vus de l’extérieur, et deux produits très différents si vous dictez à propos de clients, d’identifiants ou de travaux non publiés.

Là où la voix est vraiment mauvaise

Une liste honnête, parce que prétendre le contraire est la raison pour laquelle les gens abandonnent au bout d’une semaine.

Le schéma qui survit au contact d’une journée de travail est la saisie mixte : dire le paragraphe, taper les identifiants, et garder les deux mains sur le clavier tout du long. Claude Code est explicitement construit pour cela — la transcription est insérée à la position de votre curseur et le curseur reste à la fin, ce qui vous permet de maintenir Space, de dire une proposition, de taper un nom de fonction, et de maintenir Space à nouveau.

Comment cela fonctionne dans Speak-Y

Speak-Y est la moitié système du dispositif : appuyez sur un raccourci, parlez, et le texte apparaît là où le curseur se trouve déjà — Cursor, VS Code, JetBrains, un terminal, un navigateur, Slack. Il ne remplace pas /voice dans Claude Code ; il couvre la description de pull request et le rapport de bug que /voice ne voit jamais. La ponctuation est automatique et plus de 67 langues fonctionnent sans rien changer, ce qui compte si vous pensez dans une langue et que votre dépôt est dans une autre.

La formule gratuite, c’est 2 000 mots par semaine sans carte bancaire, sur macOS 14.0 et plus récent et Windows 10 et plus récent, plus un clavier iOS compris dans le même abonnement. Le guide d’installation couvre les autorisations et le choix du raccourci.

Il y a une seconde connexion entre la dictée et les assistants IA, facile à manquer. Le serveur MCP intégré de Speak-Y est gratuit dans toutes les formules, et il permet à Claude Code, Cursor ou ChatGPT de lire vos enregistrements et vos transcriptions de réunion en local — le contexte que vous dictez n’est donc pas le seul dont dispose l’agent. La décision que votre équipe a prise sur le flux d’authentification est dans une transcription que l’assistant peut chercher, plutôt que dans votre souvenir d’un appel.

Si votre travail tient plus des réunions que des prompts, relier les transcriptions de réunion au code dans Cursor est l’étape suivante, et vingt prompts qui fonctionnent via MCP couvre ce qu’il faut réellement demander une fois la connexion en place.

FAQ

Claude Code prend-il en charge la saisie vocale ?

Oui. Lancez /voice dans la CLI pour activer la dictée, puis maintenez Space pendant que vous parlez, ou appuyez une fois pour démarrer et une seconde fois pour envoyer. Il faut Claude Code v2.1.69 ou plus récent et un compte Claude.ai — la fonction est indisponible quand Claude Code s’authentifie par clé API, Amazon Bedrock, Google Cloud ou Microsoft Foundry. L’audio part vers les serveurs d’Anthropic plutôt que d’être transcrit sur votre machine, et il ne consomme pas de tokens ni ne compte dans vos limites d’usage.

Puis-je dicter mes prompts dans Cursor ?

Oui. Cursor a ajouté la saisie vocale intégrée dans la version 2.0 le 29 octobre 2025, et la version 3.1 du 13 avril 2026 l’a améliorée dans la fenêtre Agents : maintenez Ctrl+M pour parler, avec une forme d’onde, un minuteur et des boutons annuler ou confirmer. L’outil enregistre le clip entier puis le transcrit en un seul lot. Le texte arrive dans la zone de prompt de l’agent — pour l’éditeur, Cmd+K ou le terminal, il vous faut encore un outil de dictée système.

Pourquoi les prompts dictés fonctionnent-ils mieux que les prompts tapés ?

Parce que la longueur ne coûte plus rien. La parole va environ trois fois plus vite que la frappe : la contrainte qui pousse à écrire « corrige le bug d’auth » au lieu de trois phrases de contexte disparaît. Ces phrases supplémentaires sont exactement le contexte qui manque au modèle — les fichiers que vous avez déjà écartés, ce que disait vraiment l’erreur, ce que vous ne voulez pas voir changer.

La dictée vocale est-elle traitée en local ou dans le cloud ?

Cela dépend de l’outil, et cela vaut la peine de vérifier avant de dicter quoi que ce soit de sensible. La dictée intégrée de VS Code traite l’audio du micro sur votre appareil et n’a plus besoin de connexion une fois le modèle téléchargé. Le /voice de Claude Code envoie l’audio aux serveurs d’Anthropic. Cursor transcrit côté serveur. Parmi les applications tierces, superwhisper fait tourner des modèles locaux sur Apple Silicon, tandis qu’Aqua Voice fonctionne dans le cloud.

En quoi la dictée vocale est-elle mauvaise pour le code ?

Dans tout ce qui dépend des caractères exacts. Identifiants, expressions régulières, options de shell, JSON et chemins de fichiers ressortent faux assez souvent pour que les corriger coûte plus cher que les taper. Dictez la prose — le prompt, le commentaire de revue, le message de commit, le rapport de bug — et tapez les symboles.