语音编程:向 Claude Code 和 Cursor 口述提示词

过去一年里,主流的 AI 编程工具都上线了语音输入,所以第一个问题已经不再是能不能 口述提示词。Claude Code 有 /voice,Cursor 在智能体窗口里提供了按住说话的语音 输入,VS Code 则把听写内置进了聊天、编辑器和终端。

剩下的问题更窄,也更有用:这三者各自覆盖的都是同一个地方——你跟模型说话的那个 输入框,而开发者一整天里写文字的另外二十个地方,它们一个也没覆盖。这道缺口就是 使用系统级听写工具的全部理由,也正是语音编程真正有意思的效果不在速度上的原因 ——口述出来的提示词长度是打字的三倍,而多出来的这部分长度,恰恰是模型此前缺少的 上下文。

下文涉及的其他工具的事实,均核对于 2026 年 8 月 17 日。

每个助手现在已经能做什么

工具 如何启动 在哪里生效 音频去往何处
Claude Code /voice,然后按住 Space(也可以按一次开始、再按一次发送) CLI 提示框与智能体视图;VS Code 扩展同样支持 Anthropic 的服务器
Cursor 在 Agents 窗口里按住 Ctrl+M 智能体与聊天的输入框 Cursor 的服务器
VS Code 聊天里 ⌘I,编辑器里 ⌥⌘V 聊天、Agents 窗口、编辑器和终端 默认在你的设备上

这张表里有三处细节值得单拎出来。

Claude Code 的听写是为这份工作调过的。regexOAuthJSONlocalhost 这样的词会被当作术语识别,当前项目名和 git 分支名会自动作为识别提示 传入——这就是为什么你所在的分支会拼写正确,而不是按读音写出来。转写不消耗 token,也不计入 /usage 显示的用量上限。

它同时也是限制最多的一个。 /voice 需要 Claude.ai 账号:当 Claude Code 使用 Anthropic 的 API 密钥、Amazon Bedrock、Google Cloud 的 Agent Platform 或 Microsoft Foundry 运行时它不可用,而启用了 HIPAA 合规的组织会被策略关闭这项功能。 它需要一个本地麦克风,因此在 SSH 会话、网页版 Claude Code,以及 VS Code Remote、 Dev Containers 和 Codespaces 里都不能用。

在隐私这一项上,VS Code 是个例外。 它内置的听写在你的设备上处理麦克风音频, 模型下载完成后就不再需要联网。这项功能被标为实验性,并且在 VS Code for the Web、 Intel 芯片的 Mac、32 位与 Arm32 系统,以及 Alpine 这类基于 musl 的 Linux 发行版 上不可用——那些场景由 Speech 扩展承接。

为什么口述的提示词带着更多上下文

速度的那个数字是真的,但被夸大了。人们常引用的斯坦福研究——Ruan et al., 2016 ——测的是 iPhone 6 Plus 上的英文文本输入,结论是语音比屏幕键盘快 2.93 倍,每分钟 153 词对 52 词。坐在机械键盘前的开发者可不是每分钟 52 词,所以对这批读者来说, 诚实的倍数要小得多。

真正起作用的效果,是提示词长度上发生的变化。打字给每多写一句话都加了一层成本, 而人们最先砍掉的就是背景,因为背景感觉上可有可无,请求本身却不能省。于是打出来的 提示词是“修一下认证中间件,刷新时返回 401”,口述出来的则是这句加上你已经试过的 两件事、你怀疑的那个文件、逐字照抄的报错文本,以及那个 token 辅助函数不能改的 约束——因为另外三个服务也在调它。

这个差别不是客气。上面每一个从句都消掉了一个模型原本只能靠猜的分支,而猜错正是 那些被你丢掉的 diff 的来源。同一项研究还发现,语音在输入过程中的错误率大约只有 一半——修正比例 5.30% 对 11.22%——换个说法就是:出声思考并不比打字更嘈杂,它只是 更长。

还有一个值得点名的二阶效应。把一个 bug 说出口,会逼着你用完整的句子把它讲清楚, 而大约五次里有一次,你会在说到一半时自己解决掉它,模型还没轮上。这就是带转写记录 的小黄鸭调试法。

内置语音输入到哪里为止

这三种实现都把文字放进同一个地方:你给模型写提示词的那个框。而那个框,只占开发者 所写文字的很小一部分。

还有一条常让人栽跟头的工作流限制:内置方案没有一个能在 SSH 会话或开发容器里用, 因为麦克风在你的机器上,而工具跑在别处。如果你在远程主机上开发——这越来越常见 ——助手自带的语音输入恰好在你一天里待得最久的地方失效,而跑在你笔记本上的听写 应用照常工作,因为它就像键盘那样往终端窗口里打字。

系统级听写工具带来什么,又要付出什么

系统级工具就是一个热键,把文字插到光标所在的任何位置,所以同一个动作在 Cursor 的 智能体框、浏览器的文本域、终端和 Slack 里都成立。代价是多一份订阅、多一样要学的 东西;对于只往一个智能体面板口述的人,内置方案确实够用。核对于 2026 年 8 月 17 日:

工具 免费额度 付费 值得注意的
Wispr Flow 桌面端每周 2,000 词,iPhone 上 1,000 词 年付每用户每月 12 美元,月付 15 美元 Mac、Windows、iOS、Android
superwhisper 免费额度支持 100 多种语言与小模型 Pro 年付每月 8 美元起 本地模型,在 Apple Silicon 上表现最好
Aqua Voice 1,000 词,仅一次 Pro 每月 8 美元;Max 每月 24 美元,增加实时模式与语音命令 仅云端
Speak-Y 每周 2,000 词,无需信用卡 Pro 与 Pro+ 67 种以上语言、无机器人的会议模式、免费的本地 MCP 服务器

真正该比较的维度不是价格,而是音频去了哪里。一个在你机器上完成转写的工具,和一个 把每次口述都发往厂商 API 的工具,从外面看是同一种产品;如果你口述的内容涉及客户、 凭据或尚未发布的工作,它们就是截然不同的两种产品。

语音确实不擅长什么

一份诚实的清单,因为假装它不存在,正是很多人一周之后就放弃的原因。

能在真实工作日里活下来的模式是混合输入:段落用说的,标识符用打的,两只手始终放在 键盘上。Claude Code 明确就是为此设计的——转写结果插入在光标位置,光标停在末尾, 所以你可以按住 Space 说一句、打一个函数名、再按住 Space

这在 Speak-Y 里是怎么运作的

Speak-Y 是这套组合里系统级的那一半:按下热键,说话,文字就出现在光标已经在的 地方——Cursor、VS Code、JetBrains、终端、浏览器、Slack。它不替代 Claude Code 里的 /voice,它接手的是 /voice 永远看不到的拉取请求描述和缺陷报告。标点自动添加, 67 种以上语言无需切换任何设置即可使用——如果你用一种语言思考,而仓库用的是另一种 语言,这一点很关键。

免费套餐是每周 2,000 词、无需信用卡,支持 macOS 14.0 及以上与 Windows 10 及以上, 同一份订阅还包含 iOS 键盘。安装指南讲了权限设置和热键的挑选。

听写与 AI 助手之间还有第二条容易被忽略的联系。Speak-Y 的 内置 MCP 服务器在所有套餐上都免费,它让 Claude Code、Cursor 或 ChatGPT 能在本地读取你的录音和会议转写——于是你口述出来的上下文,不再是智能体拥有的唯一 上下文。团队关于认证流程做出的那个决定,会躺在助手可以检索的转写里,而不是躺在你 对某次通话的记忆里。

如果你的工作里会议比提示词多,下一步是 把会议转写与 Cursor 里的代码连起来, 而二十条通过 MCP 生效的提示词 讲的是连接建立之后到底该问什么。

FAQ

Claude Code 支持语音输入吗?

支持。在 CLI 里运行 /voice 开启听写,然后一边说话一边按住 Space,或者按一次开始、再按一次发送。它需要 Claude Code v2.1.69 或更高版本以及一个 Claude.ai 账号——当 Claude Code 使用 API 密钥、Amazon Bedrock、Google Cloud 或 Microsoft Foundry 认证时无法使用。音频是流式传到 Anthropic 的服务器上转写的,而不是在你的机器上,但它不消耗 token,也不计入你的用量上限。

我能在 Cursor 里口述提示词吗?

可以。Cursor 在 2025 年 10 月 29 日的 2.0 版本中加入了内置语音输入,2026 年 4 月 13 日的 3.1 版本又在 Agents 窗口里做了升级:按住 Ctrl+M 说话,界面上有波形、计时器以及取消和确认按钮。它会录下整段再一次性转写。文字落在智能体的提示框里——编辑器、Cmd+K 和终端仍然需要一个系统级的听写工具。

为什么口述的提示词比打字的更管用?

因为长度变便宜了。说话大约比打字快三倍,于是那种让人写下“修一下认证的 bug”而不是写三句背景的约束就消失了。多出来的那几句,恰恰是模型需要的上下文:你已经排除了哪些文件、报错到底说了什么、你不希望改动什么。

语音听写是在本地处理还是在云端处理?

这取决于工具,在口述敏感内容之前值得先确认。VS Code 内置的听写在你的设备上处理麦克风音频,模型下载完成后就不需要联网。Claude Code 的 /voice 会把音频传到 Anthropic 的服务器。Cursor 在服务端转写。第三方应用里,superwhisper 在 Apple Silicon 上运行本地模型,而 Aqua Voice 是纯云端的。

写代码时语音最不擅长什么?

任何字符必须精确的地方。标识符、正则表达式、命令行参数、JSON 和文件路径出错的频率高到修它们比直接打出来还费时间。口述散文——提示词、评审意见、提交信息、缺陷报告——而符号用打的。