Todas as grandes ferramentas de programação com IA ganharam entrada por voz no
último ano, então a primeira pergunta já não é se dá para ditar um prompt. O
Claude Code tem /voice, o Cursor tem entrada por voz com tecla pressionada na
sua janela de agentes e o VS Code traz ditado embutido no chat, no editor e no
terminal.
A pergunta que sobra é mais estreita e mais útil: cada um deles cobre a única caixa em que você fala com o modelo, e nenhum cobre os outros vinte lugares em que uma pessoa desenvolvedora escreve texto o dia inteiro. Essa lacuna é todo o argumento a favor de uma ferramenta de ditado que vale no sistema inteiro, e é também por isso que o efeito interessante do voice coding não é a velocidade — é que os prompts falados saem três vezes mais longos que os digitados, e o comprimento extra é justamente o contexto que faltava ao modelo.
Os fatos sobre outras ferramentas abaixo foram verificados em 17 de agosto de 2026.
| Ferramenta | Como você aciona | Onde funciona | Para onde vai o áudio |
|---|---|---|---|
| Claude Code | /voice e depois segurar Space (ou tocar uma vez para iniciar e outra para enviar) |
Prompt da CLI e visão de agente; também a extensão do VS Code | Servidores da Anthropic |
| Cursor | Segurar Ctrl+M na janela Agents |
Caixa de prompt do agente e do chat | Servidores do Cursor |
| VS Code | ⌘I no chat, ⌥⌘V no editor |
Chat, janela Agents, editores e terminais | No seu dispositivo, por padrão |
Três detalhes merecem sair dessa tabela.
O ditado do Claude Code é ajustado para a tarefa. Termos como regex,
OAuth, JSON e localhost são reconhecidos como termos, e o nome do seu
projeto atual e o nome do branch do git são passados automaticamente como pistas
de reconhecimento — é por isso que o branch em que você está sai escrito
corretamente, e não foneticamente. A transcrição não consome tokens e não conta
para os limites mostrados em /usage.
Ele também é o mais restrito. O /voice exige uma conta Claude.ai: não fica
disponível quando o Claude Code roda com uma chave de API da Anthropic, com o
Amazon Bedrock, com a Agent Platform do Google Cloud ou com o Microsoft Foundry,
e organizações com conformidade HIPAA ativada o têm desligado por política. Ele
precisa de um microfone local, então não funciona por SSH, no Claude Code na web,
nem no VS Code Remote, em Dev Containers e no Codespaces.
O VS Code é o ponto fora da curva em privacidade. O ditado embutido processa o áudio do microfone no seu dispositivo e não precisa de conexão depois que o modelo é baixado. O recurso está marcado como experimental e não está disponível no VS Code para a web, em Macs com Intel, em sistemas de 32 bits e Arm32 nem em distribuições Linux baseadas em musl, como o Alpine — a extensão Speech cobre esses casos.
O número da velocidade é real, mas é vendido além da conta. O estudo de Stanford que as pessoas citam — Ruan et al., 2016 — mediu a entrada de texto em inglês em um iPhone 6 Plus e encontrou a fala 2,93 vezes mais rápida que o teclado da tela, 153 palavras por minuto contra 52. Quem desenvolve em um teclado mecânico não digita a 52 palavras por minuto, então o multiplicador honesto para este público é menor.
O efeito que importa de verdade é o que acontece com o comprimento do prompt. Digitar cobra um custo por cada frase adicional, e a primeira coisa que as pessoas cortam é o histórico, porque o histórico parece opcional e o pedido não. Assim, o prompt digitado é «conserta o middleware de auth, ele dá 401 no refresh» e o falado é isso mais as duas coisas que você já tentou, o arquivo de que você desconfia, a mensagem de erro na íntegra e a restrição de que o helper de token não pode mudar porque outros três serviços o chamam.
Essa diferença não é gentileza. Cada uma dessas orações elimina uma bifurcação que o modelo teria de adivinhar, e adivinhar errado é o que produz o diff que você joga fora. O mesmo estudo encontrou na fala cerca de metade da taxa de erro durante a entrada — 5,30% contra 11,22% de correções —, o que é outro jeito de dizer que pensar em voz alta não é mais ruidoso que digitar, é apenas mais longo.
Há um efeito de segunda ordem que vale nomear. Descrever um bug em voz alta obriga você a enunciá-lo em frases completas, e mais ou menos uma vez em cada cinco você o resolve no meio da frase, antes de o modelo ter a vez. Isso é rubber-duck debugging com transcrição.
As três implementações colocam o texto em um lugar só: a caixa em que você fala com o modelo. Essa caixa é uma fração pequena do texto que uma pessoa desenvolvedora escreve.
Há ainda uma restrição de fluxo de trabalho que pega as pessoas de surpresa: nenhuma das opções embutidas funciona por SSH nem em um dev container, porque o microfone está na sua máquina e a ferramenta roda em outro lugar. Se você desenvolve em um host remoto — cada vez mais comum —, a entrada por voz do próprio assistente fica indisponível exatamente onde você passa o dia, enquanto um aplicativo de ditado rodando no seu notebook continua funcionando, porque ele digita na janela do terminal como um teclado faria.
Uma ferramenta que vale no sistema inteiro é um atalho de teclado que insere texto onde quer que o cursor esteja, então o mesmo gesto funciona na caixa do agente do Cursor, em uma textarea do navegador, em um terminal e no Slack. A contrapartida é que é mais uma assinatura e mais uma coisa para aprender, e para quem só dita em um painel de agente a opção embutida é realmente suficiente. Em 17 de agosto de 2026:
| Ferramenta | Plano gratuito | Pago | Destaque |
|---|---|---|---|
| Wispr Flow | 2.000 palavras/semana no desktop, 1.000 no iPhone | US$ 12/usuário por mês no anual, US$ 15 no mensal | Mac, Windows, iOS, Android |
| superwhisper | Plano gratuito com mais de 100 idiomas e modelos pequenos | Pro a partir de US$ 8/mês no anual | Modelos locais, melhor em Apple Silicon |
| Aqua Voice | 1.000 palavras, uma única vez | Pro US$ 8/mês; Max US$ 24/mês acrescenta modo em tempo real e comandos de voz | Só na nuvem |
| Speak-Y | 2.000 palavras/semana, sem cartão de crédito | Pro e Pro+ | Mais de 67 idiomas, modo reunião sem bot, servidor MCP local gratuito |
A dimensão de comparação não é o preço, e sim para onde vai o áudio. Uma ferramenta que transcreve na sua máquina e uma que manda cada ditado para a API de um fornecedor são o mesmo produto vistas de fora, e produtos muito diferentes se você dita sobre clientes, credenciais ou trabalho ainda não lançado.
Uma lista honesta, porque fingir o contrário é o que faz as pessoas desistirem depois de uma semana.
handleAuthRefresh, --no-verify, uma
expressão regular, um bloco JSON, um caminho de arquivo. Ditar isso e depois
corrigir demora mais do que digitar. Digite os símbolos, fale as frases.O padrão que sobrevive ao contato com um dia de trabalho é a entrada mista:
falar o parágrafo, digitar os identificadores e manter as duas mãos no teclado o
tempo todo. O Claude Code foi feito explicitamente para isso — a transcrição é
inserida na posição do cursor e o cursor fica no fim, então dá para segurar
Space, falar uma oração, digitar o nome de uma função e segurar Space de
novo.
O Speak-Y é a metade do arranjo que vale no sistema inteiro: aperte um atalho,
fale, e o texto aparece onde o cursor já está — Cursor, VS Code, JetBrains, um
terminal, um navegador, o Slack. Ele não substitui o /voice do Claude Code;
ele cobre a descrição do pull request e o relato de bug que o /voice nunca vê.
A pontuação é automática e mais de 67 idiomas funcionam sem trocar nada, o que
importa se você pensa em um idioma e o seu repositório está em outro.
O plano gratuito são 2.000 palavras por semana sem cartão de crédito, no macOS 14.0 ou mais recente e no Windows 10 ou mais recente, além de um teclado iOS na mesma assinatura. O guia de instalação cobre as permissões e a escolha do atalho.
Há uma segunda conexão entre ditado e assistentes de IA que passa despercebida. O servidor MCP integrado do Speak-Y é gratuito em todos os planos e permite que o Claude Code, o Cursor ou o ChatGPT leiam localmente as suas gravações e transcrições de reuniões — assim o contexto que você dita não é o único que o agente tem. A decisão que a sua equipe tomou sobre o fluxo de autenticação fica em uma transcrição que o assistente pode buscar, em vez de ficar na sua lembrança de uma chamada.
Se o seu trabalho tem mais reuniões do que prompts, ligar transcrições de reuniões ao código no Cursor é o próximo passo, e vinte prompts que funcionam via MCP cobre o que de fato perguntar quando a conexão existir.
Tem. Rode /voice na CLI para ativar o ditado e segure Space enquanto fala, ou toque uma vez para começar e outra para enviar. Exige o Claude Code v2.1.69 ou mais recente e uma conta Claude.ai — não fica disponível quando o Claude Code se autentica com chave de API, Amazon Bedrock, Google Cloud ou Microsoft Foundry. O áudio é transmitido para os servidores da Anthropic em vez de ser transcrito na sua máquina, e não consome tokens nem conta para os seus limites de uso.
Dá. O Cursor acrescentou entrada por voz embutida na versão 2.0, em 29 de outubro de 2025, e a versão 3.1, de 13 de abril de 2026, melhorou o recurso na janela Agents: segure Ctrl+M para falar, com forma de onda, cronômetro e botões de cancelar ou confirmar. Ele grava o clipe inteiro e transcreve tudo de uma vez. O texto cai na caixa de prompt do agente — para o editor, para o Cmd+K ou para o terminal você ainda precisa de uma ferramenta de ditado que valha no sistema inteiro.
Porque comprimento sai barato. A fala corre cerca de três vezes mais rápido que a digitação, então some a restrição que faz as pessoas escreverem «conserta o bug de auth» em vez de três frases de contexto. Essas frases a mais são exatamente o contexto de que o modelo precisa — quais arquivos você já descartou, o que o erro dizia de fato, o que você não quer que mude.
Depende da ferramenta, e vale conferir antes de ditar qualquer coisa sensível. O ditado embutido do VS Code processa o áudio do microfone no seu dispositivo e não precisa de conexão depois que o modelo é baixado. O /voice do Claude Code transmite o áudio para os servidores da Anthropic. O Cursor transcreve no servidor. Entre os aplicativos de terceiros, o superwhisper roda modelos locais em Apple Silicon, enquanto o Aqua Voice é baseado na nuvem.
Em tudo em que os caracteres exatos importam. Identificadores, expressões regulares, flags de shell, JSON e caminhos de arquivo saem errados com frequência suficiente para que corrigi-los custe mais do que digitá-los teria custado. Dite a prosa — o prompt, o comentário de revisão, a mensagem de commit, o relato de bug — e digite os símbolos.