OpenAI 周四给 ChatGPT 桌面版加上了语音功能:对着电脑说一句话,它就能建好一个线程、提交一份拉取请求、还顺手把一个 bug 的根因定位出来。手机版语音上线时,卖点还只是"聊得更顺、能随时打断",这次桌面版直接开始动手做事。
从"能聊"到"能动手"
这次更新用的是 OpenAI 本月早些时候发布的 ChatGPT-Live 语音模型家族。和手机版最大的差别是,桌面版语音能真的干活:可以调用 ChatGPT Work 和 Codex,还能用"computer use"能力去查网站、查应用。macOS 上还多了个 Appshots,打开后 AI 能读取你当前屏幕上的内容,包括 alt 文本。
手机版当初主打对话自然、可打断,但不具备执行能力。桌面版这次补上的,正是"动手"这一层——语音从入口,变成了操作层。
一条命令,建线程、提PR、找bug根因
官方演示里,一个开发者对着电脑说一句话,ChatGPT 依次完成了创建新线程、提交拉取请求、定位一个 bug 的根因,三件事只用一条语音指令。iOS 用户还能通过远程访问,在手机上语音操控桌面端的 Codex。
这已经不是"语音助手回答问题",是语音操作智能体去改代码库。
入口之争:OpenAI和Anthropic都盯着同一块地盘
第二天,Anthropic 也更新了 Claude 的语音模式:能调用 Opus、Sonnet、Haiku 不同模型,操作 Gmail、Calendar、Slack、Notion、Canva 完成任务。
天下熙熙,皆为入口而来
这句古话搬到这儿不算夸张。语音这次拼的不是谁说话更顺,是谁能把语音变成通向应用和工作流的入口——谁把这层焊死,谁就握住了用户下一步动作的起点。OpenAI 握着代码和 Work 场景,Anthropic 握着 Gmail、Slack 这些日常办公应用,两边打的地盘不同,争的是同一个位置。
会听话,不等于能托付
真正该盯的变量不是语音够不够自然,是这套东西能不能扛住复杂环境。演示里一条命令顺利跑完建线程、提PR、找根因三件事,但官方没给成功率、没给延迟数据,更没说失败了怎么办。真实代码库里 bug 根因判断错了怎么补救,PR提交到一半卡住谁来接手,这些都还没答案。
- 风险.Appshots让AI读取整个屏幕内容,意味着聊天记录、账号信息、内部文档都可能暴露给模型,一旦语音误触发或指令理解错位,代价不是"重新说一遍"就能了事。
这层执行力眼下仍受产品模块、系统授权、应用适配和确认流程层层约束——它还不是"语音控制整台电脑",更接近"语音在被允许的几条通道里替你按按钮"。
- 结论.桌面语音这次是真从"聊天"迈进了"操作",但能不能变成日常敢放手托付的执行层,得看权限设计和纠错机制能不能补上,现在下结论还早。
