OpenAI 今天放了个大招——ChatGPT 桌面应用正式升级,准确说是和 Codex 合体了,而这次的主角是全新推出的语音模式,背后由 GPT-Live 模型驱动。
在新版桌面应用里,聊天、办公、编程三个板块全部打通,用户可以直接用语音发起、检查或调整任务。比如你正忙着写代码,突然想起来要改个日程,张嘴说一句就行,不用切来切去。这种多线程协同,可以说是把语音交互的实用价值拉满。
回头看看发展历程,OpenAI 在 2024 年首次给 ChatGPT 塞进语音识别,之后一直在迭代。这次发布的 GPT-Live 模型厉害在哪?它是全双工语音模型——可以同时听和说,不再是“你一句我一句”的轮次对话,而是更像真人聊天,能实时打断、补充、追问。这体验上的跨越,才是关键所在。
官方声明里说得挺直白:“我们正朝着 AI 愿景前行,未来用户只需口述需求,ChatGPT 就能根据你的思路,快速推进多项任务。” 这话听着有点宏大,但具体到场景就很好理解:从单一对话里启动多个工作流程,后台智能体分头干活,你还能继续跟它唠嗑。
举个例子,规划一次商务旅行。你可以让 ChatGPT 检查日历有没有冲突,翻翻收件箱看航班有没有变动,再准备一份会议记录——所有这些,你只需要冲杯咖啡或者做点别的事,它就在后台默默搞定了。这比传统语音助手那种“一问一答”的机械感,先进了不止一个档次。

