Голосовой ввод: диктовка промптов в Claude Code и Cursor

За последний год голосовой ввод появился во всех крупных AI-инструментах для разработки, поэтому первый вопрос — уже не «можно ли продиктовать промпт». В Claude Code есть /voice, в Cursor — голосовой ввод по удержанию клавиши в окне агента, а в VS Code диктовка встроена в чат, редактор и терминал.

Остался вопрос поуже и полезнее: каждый из них закрывает одно поле — то, где вы разговариваете с моделью, — и ни один не закрывает остальные двадцать мест, где разработчик весь день печатает текст. Этот разрыв и есть весь аргумент за системную диктовку. Он же объясняет, почему интересный эффект голосового кодинга — не скорость: продиктованные промпты выходят втрое длиннее набранных, и эта лишняя длина — тот самый контекст, которого модели не хватало.

Факты о других инструментах ниже проверены 17 августа 2026 года.

Что уже умеет каждый ассистент

Инструмент Как включить Где работает Куда уходит звук
Claude Code /voice, затем удерживать Space (или нажать один раз для начала и ещё раз для отправки) Промпт CLI и вид агента; также расширение для VS Code Серверы Anthropic
Cursor Удерживать Ctrl+M в окне Agents Поле промпта агента и чата Серверы Cursor
VS Code ⌘I в чате, ⌥⌘V в редакторе Чат, окно Agents, редакторы и терминалы По умолчанию на вашем устройстве

Из этой таблицы стоит вытащить три детали.

Диктовка Claude Code настроена под задачу. Термины вроде regex, OAuth, JSON и localhost распознаются как термины, а имя текущего проекта и имя git-ветки автоматически передаются как подсказки распознавания — поэтому ветка, на которой вы сидите, выходит написанной правильно, а не фонетически. Транскрипция не тратит токены и не учитывается в лимитах, которые показывает /usage.

Он же самый ограниченный. /voice требует аккаунта Claude.ai: он недоступен, когда Claude Code работает по API-ключу Anthropic, через Amazon Bedrock, Agent Platform в Google Cloud или Microsoft Foundry, а в организациях с включённым режимом соответствия HIPAA он выключен политикой. Ему нужен локальный микрофон, поэтому он не работает по SSH, в веб-версии Claude Code, а также в VS Code Remote, Dev Containers и Codespaces.

VS Code выделяется приватностью. Встроенная диктовка обрабатывает звук микрофона на вашем устройстве, и после загрузки модели интернет ей не нужен. Функция помечена как экспериментальная и недоступна в веб-версии VS Code, на Intel-маках, в 32-битных и Arm32-системах и в дистрибутивах Linux на musl вроде Alpine — там выручает расширение Speech.

Почему в продиктованном промпте больше контекста

Цифра про скорость реальна, но переоценена. Стэнфордское исследование, на которое все ссылаются, — Ruan et al., 2016 — измеряло ввод английского текста на iPhone 6 Plus и нашло, что речь в 2,93 раза быстрее экранной клавиатуры: 153 слова в минуту против 52. Разработчик за механической клавиатурой печатает не 52 слова в минуту, поэтому честный множитель для этой аудитории меньше.

Эффект, который действительно важен, — что происходит с длиной промпта. Печать берёт плату за каждое следующее предложение, и первым люди режут предысторию: она кажется необязательной, а сама просьба — нет. Поэтому набранный промпт выглядит как «почини auth-middleware, на refresh отдаёт 401», а продиктованный — это то же самое плюс две вещи, которые вы уже пробовали, файл, на который думаете, текст ошибки дословно и условие, что хелпер токенов трогать нельзя, потому что его зовут ещё три сервиса.

Разница здесь не в вежливости. Каждое из этих придаточных убирает развилку, которую модель иначе угадывала бы, а неверная догадка — это как раз тот дифф, который вы выбрасываете. То же исследование нашло у речи примерно вдвое меньшую частоту ошибок во время ввода — 5,30% против 11,22% исправленных, — а это другой способ сказать, что размышление вслух не шумнее печати, оно просто длиннее.

Есть и эффект второго порядка, который стоит назвать. Когда вы описываете баг вслух, приходится формулировать полными предложениями, и примерно в одном случае из пяти вы решаете его на середине фразы, раньше, чем до модели дойдёт очередь. Это метод резиновой уточки, только с транскриптом.

Где встроенный голосовой ввод заканчивается

Все три реализации кладут текст в одно место: в поле, где вы пишете модели. А это малая доля того текста, который разработчик пишет за день.

Есть и рабочее ограничение, на котором люди спотыкаются: ни один из встроенных вариантов не работает по SSH и в dev-контейнере, потому что микрофон у вас, а инструмент запущен где-то ещё. Если вы разрабатываете на удалённой машине — а так делают всё чаще, — собственный голосовой ввод ассистента недоступен ровно там, где вы проводите день, тогда как приложение диктовки на ноутбуке продолжает работать: оно печатает в окно терминала так же, как это делает клавиатура.

Что добавляет системная диктовка и чего она стоит

Системный инструмент — это одна горячая клавиша, которая вставляет текст туда, где стоит курсор, поэтому один и тот же жест работает в поле агента Cursor, в textarea браузера, в терминале и в Slack. Плата за это — ещё одна подписка и ещё одна вещь, которую надо освоить; тому, кто диктует только в одну панель агента, встроенного варианта честно хватает. Проверено 17 августа 2026 года:

Инструмент Бесплатный тариф Платно Особенности
Wispr Flow 2000 слов в неделю на десктопе, 1000 на iPhone $12 за пользователя в месяц при годовой оплате, $15 при помесячной Mac, Windows, iOS, Android
superwhisper Бесплатный тариф со 100+ языками и небольшими моделями Pro от $8 в месяц при годовой оплате Локальные модели, лучше всего на Apple Silicon
Aqua Voice 1000 слов, единоразово Pro $8 в месяц; Max $24 в месяц добавляет режим реального времени и голосовые команды Только облако
Speak-Y 2000 слов в неделю, без банковской карты Pro и Pro+ 67+ языков, режим встреч без ботов, бесплатный локальный MCP-сервер

Сравнивать здесь стоит не цену, а то, куда уходит звук. Инструмент, который распознаёт на вашей машине, и инструмент, который отправляет каждую диктовку в API вендора, снаружи выглядят одинаковым продуктом — и оказываются очень разными, если вы диктуете про клиентов, доступы или невыпущенную работу.

В чём голос по-честному плох

Честный список, потому что делать вид, что его нет, — это ровно то, из-за чего люди бросают затею через неделю.

Схема, которая переживает столкновение с рабочим днём, — смешанный ввод: абзац говорите, идентификаторы печатайте и всё время держите обе руки на клавиатуре. Claude Code сделан ровно под это: расшифровка вставляется в позицию курсора, и курсор остаётся в конце, так что можно удержать Space, сказать фразу, напечатать имя функции и снова удержать Space.

Как это устроено в Speak-Y

Speak-Y — системная половина этой связки: нажали горячую клавишу, сказали, и текст появился там, где уже стоит курсор, — в Cursor, VS Code, JetBrains, терминале, браузере, Slack. Он не заменяет /voice в Claude Code, он закрывает описание пул-реквеста и баг-репорт, которых /voice никогда не видит. Пунктуация расставляется автоматически, а 67+ языков работают без переключения чего бы то ни было — это важно, если думаете вы на одном языке, а репозиторий у вас на другом.

Бесплатный тариф — 2000 слов в неделю без банковской карты, на macOS 14.0 и новее и Windows 10 и новее, плюс клавиатура iOS в той же подписке. Гайд по установке разбирает разрешения и выбор горячей клавиши.

Есть и вторая связь между диктовкой и AI-ассистентами, которую легко упустить. Встроенный MCP-сервер Speak-Y бесплатен на всех тарифах и позволяет Claude Code, Cursor или ChatGPT читать ваши записи и транскрипты встреч локально — так что контекст, который вы диктуете, оказывается не единственным контекстом у агента. Решение, которое команда приняла про схему авторизации, лежит в транскрипте, по которому ассистент может искать, а не в вашей памяти о созвоне.

Если у вас больше встреч, чем промптов, следующий шаг — связать транскрипты встреч с кодом в Cursor, а двадцать промптов, которые работают через MCP рассказывают, что именно спрашивать, когда связь уже настроена.

FAQ

Поддерживает ли Claude Code голосовой ввод?

Да. Введите /voice в CLI, чтобы включить диктовку, затем удерживайте Space, пока говорите, или нажмите один раз для начала и ещё раз для отправки. Нужен Claude Code v2.1.69 или новее и аккаунт Claude.ai — с API-ключом, Amazon Bedrock, Google Cloud или Microsoft Foundry функция недоступна. Звук передаётся на серверы Anthropic, а не распознаётся на вашей машине, и при этом он не тратит токены и не учитывается в лимитах.

Можно ли диктовать промпты в Cursor?

Да. Cursor добавил встроенный голосовой ввод в версии 2.0 29 октября 2025 года, а версия 3.1 от 13 апреля 2026 года улучшила его в окне Agents: удерживайте Ctrl+M и говорите — есть осциллограмма, таймер и кнопки отмены и подтверждения. Запись идёт целиком и распознаётся одним куском. Текст попадает в поле промпта агента; для редактора, Cmd+K и терминала по-прежнему нужен системный инструмент диктовки.

Почему продиктованные промпты работают лучше набранных?

Потому что длина ничего не стоит. Речь примерно втрое быстрее печати, поэтому исчезает то ограничение, из-за которого человек пишет «почини баг с авторизацией» вместо трёх предложений предыстории. Эти лишние предложения — ровно тот контекст, который нужен модели: какие файлы вы уже исключили, что именно сказала ошибка, что менять нельзя.

Диктовка обрабатывается локально или в облаке?

Зависит от инструмента, и это стоит проверить, прежде чем диктовать что-то чувствительное. Встроенная диктовка VS Code обрабатывает звук микрофона на устройстве, и после загрузки модели соединение ей не нужно. /voice в Claude Code передаёт звук на серверы Anthropic. Cursor распознаёт на своей стороне. Из сторонних приложений superwhisper запускает локальные модели на Apple Silicon, а Aqua Voice работает только в облаке.

В чём голос плох при работе с кодом?

Во всём, где важны конкретные символы. Идентификаторы, регулярные выражения, флаги командной строки, JSON и пути к файлам выходят неверно достаточно часто, чтобы их починка стоила дороже, чем набор с клавиатуры. Диктуйте прозу — промпт, комментарий в ревью, сообщение коммита, баг-репорт, — а символы печатайте.