Voice Coding: Prompts an Claude Code und Cursor diktieren

Alle großen KI-Werkzeuge zum Programmieren haben im letzten Jahr Spracheingabe bekommen, die erste Frage lautet also nicht mehr, ob Sie einen Prompt diktieren können. Claude Code hat /voice, Cursor hat Spracheingabe per gehaltener Taste in seinem Agents-Fenster, und VS Code hat Diktat in Chat, Editor und Terminal eingebaut.

Die Frage, die bleibt, ist enger und nützlicher: Jedes dieser Werkzeuge deckt genau das eine Feld ab, in dem Sie mit dem Modell sprechen, und keines deckt die zwanzig anderen Stellen ab, an denen ein Entwickler den ganzen Tag Prosa tippt. Diese Lücke ist das ganze Argument für ein systemweites Diktierwerkzeug, und sie ist zugleich der Grund, warum der interessante Effekt von Voice Coding nicht Geschwindigkeit ist — sondern dass gesprochene Prompts dreimal so lang ausfallen wie getippte, und die zusätzliche Länge genau der Kontext ist, der dem Modell gefehlt hat.

Die Angaben zu anderen Werkzeugen wurden am 17. August 2026 geprüft.

Was jeder Assistent bereits kann

Werkzeug Wie Sie es starten Wo es funktioniert Wohin der Ton geht
Claude Code /voice, dann Space halten (oder einmal tippen zum Starten und erneut zum Senden) CLI-Prompt und Agent-Ansicht; auch die VS-Code-Erweiterung Anthropics Server
Cursor Im Agents-Fenster Ctrl+M halten Eingabefeld von Agent und Chat Cursors Server
VS Code ⌘I im Chat, ⌥⌘V im Editor Chat, Agents-Fenster, Editoren und Terminals Standardmäßig auf Ihrem Gerät

Drei Details lohnt es sich aus dieser Tabelle herauszuziehen.

Das Diktat von Claude Code ist auf die Aufgabe zugeschnitten. Begriffe wie regex, OAuth, JSON und localhost werden als Fachbegriffe erkannt, und der Name Ihres aktuellen Projekts sowie Ihr git-Branch werden automatisch als Erkennungshinweise übergeben — deshalb kommt der Branch, auf dem Sie arbeiten, korrekt geschrieben heraus statt lautmalerisch. Die Transkription verbraucht keine Tokens und wird nicht auf die Limits angerechnet, die /usage anzeigt.

Es ist zugleich am stärksten eingeschränkt. /voice braucht ein Claude.ai-Konto: Es steht nicht zur Verfügung, wenn Claude Code über einen Anthropic-API-Schlüssel, Amazon Bedrock, die Agent Platform von Google Cloud oder Microsoft Foundry läuft, und in Organisationen mit aktivierter HIPAA-Compliance ist es per Richtlinie abgeschaltet. Es braucht ein lokales Mikrofon, funktioniert also nicht über SSH, in Claude Code im Web oder in VS Code Remote, Dev Containers und Codespaces.

Bei der Privatsphäre fällt VS Code aus der Reihe. Sein eingebautes Diktat verarbeitet den Mikrofonton auf Ihrem Gerät und braucht keine Internetverbindung, sobald das Modell heruntergeladen ist. Die Funktion ist als experimentell markiert und steht in VS Code für das Web, auf Intel-Macs, auf 32-Bit- und Arm32-Systemen sowie auf musl-basierten Linux-Distributionen wie Alpine nicht zur Verfügung — dort springt die Speech-Erweiterung ein.

Warum ein gesprochener Prompt mehr Kontext trägt

Die Zahl zur Geschwindigkeit stimmt, wird aber überverkauft. Die viel zitierte Stanford-Studie — Ruan et al., 2016 — hat englische Texteingabe auf einem iPhone 6 Plus gemessen und fand Sprache 2,93-mal schneller als die Bildschirmtastatur, 153 Wörter pro Minute gegen 52. Wer an einer mechanischen Tastatur entwickelt, tippt keine 52 Wörter pro Minute, der ehrliche Faktor für dieses Publikum ist also kleiner.

Der Effekt, auf den es wirklich ankommt, betrifft die Länge des Prompts. Tippen belegt jeden weiteren Satz mit Kosten, und das Erste, was gestrichen wird, ist der Hintergrund, weil Hintergrund optional wirkt und die Bitte nicht. So lautet der getippte Prompt „Repariere die Auth-Middleware, sie liefert beim Refresh 401“, und der gesprochene ist derselbe Satz plus die beiden Dinge, die Sie schon versucht haben, die Datei, die Sie verdächtigen, den Fehlertext im Wortlaut und die Bedingung, dass der Token-Helper unverändert bleiben muss, weil drei andere Dienste ihn aufrufen.

Dieser Unterschied ist keine Höflichkeit. Jeder dieser Nebensätze nimmt dem Modell eine Verzweigung ab, die es sonst raten müsste, und falsches Raten erzeugt genau den Diff, den Sie wegwerfen. Dieselbe Studie fand bei Sprache ungefähr die halbe Fehlerquote während der Eingabe — 5,30 % gegen 11,22 % korrigierte Fehler —, was anders gesagt bedeutet: Lautes Denken ist nicht unsauberer als Tippen, es ist nur länger.

Es gibt einen Effekt zweiter Ordnung, den man benennen sollte. Einen Bug laut zu beschreiben zwingt Sie, ihn in ganzen Sätzen zu formulieren, und etwa jedes fünfte Mal lösen Sie ihn mitten im Satz, bevor das Modell an die Reihe kommt. Das ist Rubber-Duck-Debugging mit Transkript.

Wo die eingebaute Spracheingabe aufhört

Alle drei Umsetzungen legen den Text an eine Stelle: in das Feld, in dem Sie das Modell ansprechen. Dieses Feld ist ein kleiner Bruchteil der Prosa, die ein Entwickler schreibt.

Dazu kommt eine Einschränkung im Arbeitsablauf, die viele überrascht: Keine der eingebauten Optionen funktioniert über SSH oder in einem Dev Container, weil das Mikrofon an Ihrem Rechner hängt und das Werkzeug woanders läuft. Wenn Sie auf einem entfernten Host entwickeln — zunehmend üblich —, ist die Spracheingabe des Assistenten genau dort nicht verfügbar, wo Sie den Tag verbringen, während eine Diktier-App auf Ihrem Laptop weiterarbeitet, weil sie in das Terminalfenster tippt wie eine Tastatur.

Was ein systemweites Diktierwerkzeug ergänzt und was es kostet

Ein systemweites Werkzeug ist ein Tastenkürzel, das Text dort einfügt, wo der Cursor steht — dieselbe Geste funktioniert also im Agent-Feld von Cursor, in einer Textarea im Browser, in einem Terminal und in Slack. Der Preis dafür: noch ein Abo und noch etwas zu lernen. Wer ohnehin nur in ein einziges Agent-Panel diktiert, ist mit der eingebauten Option wirklich gut bedient. Stand 17. August 2026:

Werkzeug Kostenloser Tarif Bezahlt Bemerkenswert
Wispr Flow 2.000 Wörter/Woche am Desktop, 1.000 auf dem iPhone 12 $/Nutzer/Monat bei Jahreszahlung, 15 $ monatlich Mac, Windows, iOS, Android
superwhisper Kostenloser Tarif mit über 100 Sprachen und kleinen Modellen Pro ab 8 $/Monat bei Jahreszahlung Lokale Modelle, am besten auf Apple Silicon
Aqua Voice 1.000 Wörter, einmalig Pro 8 $/Monat; Max 24 $/Monat ergänzt Echtzeitmodus und Sprachbefehle Nur Cloud
Speak-Y 2.000 Wörter/Woche, ohne Kreditkarte Pro und Pro+ Über 67 Sprachen, Meeting-Modus ohne Bot, kostenloser lokaler MCP-Server

Die Dimension, auf die es beim Vergleich ankommt, ist nicht der Preis, sondern wohin der Ton geht. Ein Werkzeug, das auf Ihrem Rechner transkribiert, und eines, das jedes Diktat an die API eines Anbieters schickt, sind von außen dasselbe Produkt und sehr verschiedene, sobald Sie über Kunden, Zugangsdaten oder unveröffentlichte Arbeit diktieren.

Was Sprache wirklich schlecht kann

Eine ehrliche Liste, denn das Gegenteil zu behaupten ist der Grund, warum Leute nach einer Woche wieder abspringen.

Das Muster, das einen Arbeitstag übersteht, ist gemischte Eingabe: den Absatz sprechen, die Bezeichner tippen und dabei beide Hände auf der Tastatur lassen. Claude Code ist ausdrücklich dafür gebaut — das Transkript wird an der Cursorposition eingefügt und der Cursor bleibt am Ende stehen, Sie können also Space halten, einen Satzteil sprechen, einen Funktionsnamen tippen und wieder Space halten.

Wie das in Speak-Y funktioniert

Speak-Y ist die systemweite Hälfte des Aufbaus: Tastenkürzel drücken, sprechen, und der Text erscheint dort, wo der Cursor ohnehin steht — Cursor, VS Code, JetBrains, ein Terminal, ein Browser, Slack. Es ersetzt /voice in Claude Code nicht; es deckt die Beschreibung des Pull Requests und den Fehlerbericht ab, die /voice nie zu sehen bekommt. Die Zeichensetzung entsteht automatisch, und über 67 Sprachen funktionieren, ohne dass Sie etwas umstellen — was zählt, wenn Sie in der einen Sprache denken und Ihr Repository in einer anderen liegt.

Der kostenlose Tarif umfasst 2.000 Wörter pro Woche ohne Kreditkarte, unter macOS 14.0 und neuer sowie Windows 10 und neuer, dazu eine iOS-Tastatur im selben Abo. Die Installationsanleitung behandelt Berechtigungen und die Wahl des Tastenkürzels.

Es gibt eine zweite Verbindung zwischen Diktat und KI-Assistenten, die leicht übersehen wird. Der eingebaute MCP-Server von Speak-Y ist in jedem Tarif kostenlos und lässt Claude Code, Cursor oder ChatGPT Ihre Aufnahmen und Meeting-Transkripte lokal lesen — der Kontext, den Sie diktieren, ist damit nicht der einzige, den der Agent hat. Die Entscheidung, die Ihr Team zum Auth-Flow getroffen hat, liegt dann in einem Transkript, das der Assistent durchsuchen kann, statt in Ihrer Erinnerung an ein Gespräch.

Wenn Ihre Arbeit aus mehr Meetings als Prompts besteht, ist Meeting-Transkripte mit Code in Cursor verbinden der nächste Schritt, und zwanzig Prompts, die über MCP funktionieren behandelt, was man tatsächlich fragen sollte, sobald die Verbindung steht.

FAQ

Unterstützt Claude Code Spracheingabe?

Ja. Führen Sie /voice in der CLI aus, um das Diktat einzuschalten, und halten Sie dann Space, während Sie sprechen — oder tippen Sie einmal zum Starten und erneut zum Senden. Es setzt Claude Code v2.1.69 oder neuer und ein Claude.ai-Konto voraus und steht nicht zur Verfügung, wenn sich Claude Code über einen API-Schlüssel, Amazon Bedrock, Google Cloud oder Microsoft Foundry authentifiziert. Der Ton wird an Anthropics Server gestreamt statt auf Ihrem Rechner transkribiert, verbraucht keine Tokens und wird nicht auf Ihre Nutzungslimits angerechnet.

Kann ich Prompts in Cursor diktieren?

Ja. Cursor hat in Version 2.0 am 29. Oktober 2025 eine eingebaute Spracheingabe ergänzt, und Version 3.1 vom 13. April 2026 hat sie im Agents-Fenster erweitert: Ctrl+M halten und sprechen, mit Wellenform, Timer sowie Schaltflächen zum Abbrechen und Bestätigen. Der ganze Mitschnitt wird aufgenommen und am Stück transkribiert. Der Text landet im Eingabefeld des Agenten — für den Editor, für Cmd+K oder für das Terminal brauchen Sie weiterhin ein systemweites Diktierwerkzeug.

Warum funktionieren gesprochene Prompts besser als getippte?

Weil Länge billig ist. Sprechen läuft etwa dreimal schneller als Tippen, damit fällt der Zwang weg, der Menschen „Behebe den Auth-Bug“ schreiben lässt statt drei Sätzen Hintergrund. Genau diese zusätzlichen Sätze sind der Kontext, den das Modell braucht — welche Dateien Sie bereits ausgeschlossen haben, was in der Fehlermeldung wirklich stand, was unverändert bleiben soll.

Wird Sprachdiktat lokal oder in der Cloud verarbeitet?

Das hängt vom Werkzeug ab, und es lohnt sich, das zu prüfen, bevor Sie Sensibles diktieren. Das eingebaute Diktat von VS Code verarbeitet den Mikrofonton auf Ihrem Gerät und braucht nach dem Download des Modells keine Verbindung mehr. Das /voice von Claude Code streamt den Ton an Anthropics Server. Cursor transkribiert serverseitig. Unter den Apps von Drittanbietern führt superwhisper lokale Modelle auf Apple Silicon aus, während Aqua Voice in der Cloud arbeitet.

Was kann Sprache beim Programmieren schlecht?

Alles, wo die genauen Zeichen zählen. Bezeichner, reguläre Ausdrücke, Shell-Flags, JSON und Dateipfade kommen oft genug falsch heraus, dass die Korrektur mehr kostet als das Tippen gekostet hätte. Diktieren Sie die Prosa — den Prompt, den Review-Kommentar, die Commit Message, den Fehlerbericht — und tippen Sie die Symbole.