Voice coding: dictar prompts a Claude Code y a Cursor

Todas las grandes herramientas de programación con IA lanzaron entrada de voz en el último año, así que la primera pregunta ya no es si se puede dictar un prompt. Claude Code tiene /voice, Cursor tiene entrada de voz con tecla mantenida en su ventana de agente y VS Code lleva el dictado integrado en el chat, el editor y el terminal.

La pregunta que queda es más estrecha y más útil: cada una de ellas cubre la única caja en la que usted habla con el modelo, y ninguna cubre los otros veinte sitios en los que un desarrollador escribe prosa todo el día. Ese hueco es todo el argumento a favor de una herramienta de dictado de sistema, y es también la razón de que el efecto interesante del voice coding no sea la velocidad: es que los prompts hablados salen tres veces más largos que los escritos, y esa longitud de más es contexto que al modelo le faltaba.

Los datos sobre otras herramientas que siguen se comprobaron el 17 de agosto de 2026.

Qué hace ya cada asistente

Herramienta Cómo se activa Dónde funciona Adónde va el audio
Claude Code /voice y luego mantener Space (o pulsar una vez para empezar y otra para enviar) Prompt de la CLI y vista de agente; también la extensión de VS Code Los servidores de Anthropic
Cursor Mantener Ctrl+M en la ventana Agents Caja de prompt del agente y del chat Los servidores de Cursor
VS Code ⌘I en el chat, ⌥⌘V en el editor Chat, ventana Agents, editores y terminales En su dispositivo por defecto

Merece la pena sacar tres detalles de esa tabla.

El dictado de Claude Code está afinado para este trabajo. Términos como regex, OAuth, JSON y localhost se reconocen como términos, y el nombre de su proyecto actual y el de su rama de git se pasan automáticamente como pistas de reconocimiento, que es la razón de que la rama en la que está salga bien escrita y no fonéticamente. La transcripción no consume tokens y no cuenta para los límites que muestra /usage.

Es también la más restringida. /voice necesita una cuenta de Claude.ai: no está disponible cuando Claude Code funciona con una clave de la API de Anthropic, con Amazon Bedrock, con la Agent Platform de Google Cloud o con Microsoft Foundry, y las organizaciones con el cumplimiento de HIPAA activado la tienen desactivada por política. Necesita un micrófono local, así que no funciona por SSH, ni en Claude Code en la web, ni en VS Code Remote, Dev Containers y Codespaces.

VS Code es la excepción en privacidad. Su dictado integrado procesa el audio del micrófono en su dispositivo y no necesita conexión a internet una vez descargado el modelo. La función está marcada como experimental y no está disponible en VS Code for the Web, en los Mac con Intel, en sistemas de 32 bits y Arm32 ni en las distribuciones de Linux basadas en musl como Alpine: para eso está la extensión Speech.

Por qué un prompt hablado lleva más contexto

La cifra de velocidad es real, pero está sobrevendida. El estudio de Stanford que se cita — Ruan et al., 2016 — midió la escritura de texto en inglés en un iPhone 6 Plus y encontró que hablar era 2,93 veces más rápido que el teclado en pantalla: 153 palabras por minuto frente a 52. Un desarrollador con un teclado mecánico no teclea a 52 palabras por minuto, así que el multiplicador honesto para este público es menor.

El efecto que de verdad importa es lo que le pasa a la longitud del prompt. Teclear impone un coste a cada frase adicional, y lo primero que se recorta es el contexto, porque el contexto parece opcional y la petición no. Así que el prompt escrito es «arregla el middleware de auth, da 401 al refrescar» y el hablado es eso más las dos cosas que ya ha probado, el archivo del que sospecha, el texto exacto del error y la restricción de que el helper de tokens no puede cambiar porque hay otros tres servicios que lo llaman.

Esa diferencia no es cortesía. Cada una de esas cláusulas elimina una rama que el modelo tendría que adivinar, y adivinar mal es lo que produce el diff que acaba tirando. El mismo estudio encontró que hablar tenía aproximadamente la mitad de errores durante la entrada — un 5,30 % frente a un 11,22 % corregido —, que es una manera de decir que pensar en voz alta no es más ruidoso que teclear, solo más largo.

Hay un efecto de segundo orden que conviene nombrar. Describir un error en voz alta le obliga a enunciarlo en frases completas, y aproximadamente una de cada cinco veces lo resuelve a mitad de frase, antes de que al modelo le toque responder. Eso es depuración con patito de goma, pero con transcripción.

Dónde se acaba la entrada de voz integrada

Las tres implementaciones dejan el texto en el mismo sitio: la caja donde usted escribe el prompt al modelo. Esa caja es una fracción pequeña de la prosa que escribe un desarrollador.

Hay además una limitación de flujo de trabajo que pilla a mucha gente: ninguna de las opciones integradas funciona por SSH ni en un dev container, porque el micrófono está en su máquina y la herramienta se ejecuta en otro sitio. Si desarrolla en un host remoto — cada vez más habitual —, la entrada de voz del propio asistente no está disponible justo donde pasa el día, mientras que una aplicación de dictado que corre en su portátil sigue funcionando, porque escribe en la ventana del terminal igual que lo hace un teclado.

Qué añade una herramienta de dictado de sistema y qué cuesta

Una herramienta de sistema es un solo atajo que inserta texto allá donde esté el cursor, así que el mismo gesto vale en la caja de agente de Cursor, en un campo de texto del navegador, en un terminal y en Slack. La contrapartida es que es una suscripción más y una cosa más que aprender, y para quien solo dicta en un único panel de agente la opción integrada basta de verdad. Comprobado el 17 de agosto de 2026:

Herramienta Plan gratuito De pago A destacar
Wispr Flow 2000 palabras a la semana en escritorio, 1000 en iPhone 12 $/usuario/mes en pago anual, 15 $ al mes Mac, Windows, iOS, Android
superwhisper Plan gratuito con más de 100 idiomas y modelos pequeños Pro desde 8 $/mes en pago anual Modelos locales, mejor en Apple Silicon
Aqua Voice 1000 palabras, una sola vez Pro 8 $/mes; Max 24 $/mes añade modo en tiempo real y comandos de voz Solo en la nube
Speak-Y 2000 palabras a la semana, sin tarjeta Pro y Pro+ Más de 67 idiomas, modo reunión sin bot, servidor MCP local gratuito

La dimensión con la que comparar no es el precio, sino adónde va el audio. Una herramienta que transcribe en su máquina y otra que manda cada dictado a la API de un proveedor son el mismo producto vistas desde fuera, y productos muy distintos si dicta sobre clientes, credenciales o trabajo sin publicar.

En qué es realmente mala la voz

Una lista honesta, porque fingir lo contrario es la razón de que la gente abandone al cabo de una semana.

El patrón que sobrevive al contacto con una jornada de trabajo es la entrada mixta: hablar el párrafo, teclear los identificadores y mantener las dos manos en el teclado todo el rato. Claude Code está construido explícitamente para eso: la transcripción se inserta en la posición del cursor y el cursor se queda al final, así que puede mantener Space, decir una frase, teclear el nombre de una función y volver a mantener Space.

Cómo funciona esto en Speak-Y

Speak-Y es la mitad de sistema del montaje: pulse un atajo, hable y el texto aparece allá donde ya está el cursor — Cursor, VS Code, JetBrains, un terminal, un navegador, Slack. No sustituye a /voice en Claude Code; cubre la descripción de pull request y el informe de error que /voice no ve nunca. La puntuación es automática y funcionan más de 67 idiomas sin cambiar nada, lo que importa si usted piensa en un idioma y su repositorio está en otro.

El plan gratuito son 2000 palabras a la semana sin tarjeta, en macOS 14.0 y posterior y en Windows 10 y posterior, más un teclado de iOS incluido en la misma suscripción. La guía de instalación cubre los permisos y la elección del atajo.

Hay una segunda conexión entre el dictado y los asistentes de IA que es fácil pasar por alto. El servidor MCP integrado de Speak-Y es gratuito en todos los planes y permite que Claude Code, Cursor o ChatGPT lean en local sus grabaciones y sus transcripciones de reunión, de modo que el contexto que usted dicta no es el único que tiene el agente. La decisión que tomó su equipo sobre el flujo de autenticación está en una transcripción en la que el asistente puede buscar, y no en su recuerdo de una llamada.

Si su trabajo son más reuniones que prompts, enlazar las transcripciones de reunión con el código en Cursor es el siguiente paso, y veinte prompts que funcionan por MCP cubre qué preguntar de verdad una vez existe la conexión.

FAQ

¿Admite Claude Code la entrada de voz?

Sí. Ejecute /voice en la CLI para activar el dictado y luego mantenga pulsada Space mientras habla, o pulse una vez para empezar y otra para enviar. Hace falta Claude Code v2.1.69 o posterior y una cuenta de Claude.ai: no está disponible cuando Claude Code se autentica con una clave de API, con Amazon Bedrock, Google Cloud o Microsoft Foundry. El audio se envía a los servidores de Anthropic en vez de transcribirse en su máquina, y no consume tokens ni cuenta para sus límites de uso.

¿Puedo dictar prompts en Cursor?

Sí. Cursor añadió entrada de voz integrada en la versión 2.0 el 29 de octubre de 2025, y la versión 3.1 del 13 de abril de 2026 la mejoró en la ventana Agents: mantenga Ctrl+M para hablar, con onda de audio, temporizador y botones de cancelar o confirmar. Graba el clip entero y lo transcribe de una sola vez. El texto cae en la caja de prompt del agente; para el editor, Cmd+K o el terminal sigue necesitando una herramienta de dictado de sistema.

¿Por qué funcionan mejor los prompts hablados que los escritos?

Porque la longitud sale barata. Hablar va unas tres veces más rápido que teclear, así que desaparece la restricción que lleva a escribir «arregla el bug de auth» en lugar de tres frases de contexto. Esas frases de más son justo el contexto que le falta al modelo: qué archivos ya ha descartado, qué decía el error exactamente, qué no quiere que se toque.

¿El dictado de voz se procesa en local o en la nube?

Depende de la herramienta, y conviene comprobarlo antes de dictar nada sensible. El dictado integrado de VS Code procesa el audio del micrófono en su dispositivo y no necesita conexión una vez descargado el modelo. El /voice de Claude Code envía el audio a los servidores de Anthropic. Cursor transcribe en servidor. Entre las aplicaciones de terceros, superwhisper ejecuta modelos locales en Apple Silicon, mientras que Aqua Voice funciona en la nube.

¿En qué es mala la voz cuando se programa?

En todo aquello donde importan los caracteres exactos. Identificadores, expresiones regulares, flags de shell, JSON y rutas de archivo salen mal con la frecuencia suficiente para que corregirlos cueste más que haberlos tecleado. Dicte la prosa — el prompt, el comentario de revisión, el mensaje de commit, el informe de error — y teclee los símbolos.