OpenAI GPT-Live语音模型发布会现场

ChatGPT终于学会了一件事:别急着抢话

2026-07-09 · 阅读时间约8分钟
文|犀牛伯爵

你有没有过这种体验。正在跟ChatGPT语音聊天,说到一半稍微停顿了一下组织语言,它就急着接话了。或者旁边路过一辆公交车,引擎声刚响,它就以为你说完了,直接开始输出一大段。

整个交流过程就像一场严格遵循"你一句、我一句"规则的对口相声。但对方是个没有情商的搭档,不管你的气口在哪儿,它都按自己的节奏来。

北京时间今天凌晨,OpenAI发布了新一代语音模型GPT-Live。用Sam Altman自己的话说,"感觉很神奇、很真实",还发了条推表示自己一直更喜欢打字,但这件事要变了。

说实话我一开始也没太当回事。语音模型的升级又不是第一次了。但看完官方博客和评测数据之后,我觉得这次可能真的不太一样。

从对讲机到电话

要理解GPT-Live做了什么,得先回顾一下AI语音经历过的三代架构。

AI语音的三代进化

1
级联系统(2023年)——你说话 → 语音转文字 → 大模型生成回复 → 文字转语音。三个模型串联,信息来回折腾,延迟高、语气僵硬
2
回合制语音(Advanced Voice Mode)——单模型端到端处理音频,延迟低了,但必须等你闭嘴才接话。基于"静音检测",容易被噪音误导
3
全双工(GPT-Live,今天发布)——同时听和说。模型每秒做多次决策,该说话就说话,该听就听,该等就等

打个比方。第一代像写信,来回一趟要好几天。第二代像对讲机,你说完按按钮它才能回。第三代终于像打电话了,双方可以同时说话,抢话、插话、沉默,都处理得自然。

这个"像打电话"的体验,来自两个底层架构变化。第一个叫持续交互(Continuous Interaction)。GPT-Live不是把你每句话当成一个独立输入来处理,而是在持续处理音频流的同时持续生成音频输出。模型每秒可以做很多次交互决策,是该说话、该继续听、该停顿、该打断、还是该调用工具。

第二个变化更绝。叫异步委托(Delegation)

怎么说呢,你可以把GPT-Live理解成一个"前台接待"。它负责跟你聊天、接话、垫话、让你感觉舒适。但如果你的问题需要联网搜索、深度推理或者执行复杂任务,它会在后台悄悄把活儿"外包"给另一个模型。首批上线时,这个后台模型是GPT-5.5。

最巧妙的地方在于,后台模型吭哧吭哧算的时候,前台并不闲着。它会继续用自然的语音跟你保持互动,不会让你觉得冷场。等后台算完了,它再把结果无缝融入对话。

当你问了一个需要搜索的复杂问题,GPT-Live可以先跟你说"这个问题挺有意思,让我查一下",然后继续用语音跟你闲聊或者补充背景,直到答案准备好。

具体强在哪里

官方博客列了几个具体的能力提升,我挑最值得说的讲。

学会了"垫话"。当你在长篇大论的时候,GPT-Live不会再一声不吭地等你。它会适时发出"嗯嗯"、"对"、"明白"这样的语气词。别小看这个功能,这是人类对话中最基础但最被忽视的社交信号。你跟一个人说话,对方全程面无表情一声不吭,哪怕他在认真听,你也会觉得不舒服。

懂得了"闭嘴"。如果你说话卡壳了,或者直接说"让我想一下",它会安静等你。之前的AVM基于静音检测来判断你是否说完,你一停它就抢话。GPT-Live能区分"停顿思考"和"说完",不会在你不该被打断的时候插嘴。

抗干扰能力升级。走在马路上旁边有人说话、或者办公室里有背景噪音,它更能锁定你的声音而非被噪音带偏。

实时双向翻译。这是全新的能力。你这边说着中文,它可以同声翻译成英文说出去,两种语言在同一条对话里无缝交错。这对跨语言场景来说确实很实用。

可视化卡片。语音对话中,如果你问了天气、股票、体育比分这类信息,它会在屏幕上弹出视觉卡片,不用你单独打开App去看。

语速可调。跟它说"说慢一点",它不会像以前那样机械地降速播放,而是重新组织语序并插入自然的停顿。

OpenAI还为GPT-Live重新调整了ChatGPT里9个预设音色的声音表现力。付费用户可以选择三个推理强度档位,Instant适合要快的问题,Medium和High适合需要深度思考的场景。免费用户则默认使用GPT-Live-1 mini,核心交互能力完整,后台推理用轻量版。

看看数据

官方做了盲测。测试者与模型进行5到10分钟的连续对话,然后在两版语音之间做选择。结果挺夸张的。

评测维度GPT-Live-1上一代AVM 用户偏好率75.7%24.3% 对话流畅度(7分制)4.963.80 GPQA(专家级科学推理)84.2%(High档)45.3% BrowseComp(复杂网页搜索)75.2%0.7% 多轮电信客服任务全面领先基线

图源:OpenAI官方博客

BrowseComp这个数据最让我注意。上一代AVM只有0.7%的准确率,基本上等于不会用。GPT-Live直接飙到75.2%,从不可用跨越到了能干活的水平。这主要归功于异步委托机制,后台GPT-5.5帮你搜索和推理,前台GPT-Live把结果用语音自然地说出来。

GPQA测试的是物理、化学、生物领域的专家级推理。在High推理档位下,GPT-Live拿到了84.2%的准确率,接近上一代的两倍。

但也有几个坑

说完了好的,说说目前还不太行的地方。

桌面版暂未更新。截至今天,新版语音体验只覆盖了iOS、Android和网页端。桌面App还没同步,需要继续用旧版。

不支持视频和屏幕共享。首发阶段,如果你需要对着屏幕或者视频跟ChatGPT语音交互,得切回Legacy Voice。

多语言口音问题。OpenAI说GPT-Live只针对ChatGPT上最热门的几种语言做了充分优化。某些语言下可能带着"外国口音"或者偶尔词不达意。他们表示在加紧改进。

推理档位需要手动选。Instant、Medium、High三个档位得你自己判断用哪个。有时候你也不知道问题到底需要多深的推理,选错了要么白等要么质量不够。

API还没开放。GPT-Live-1的API暂未上线,OpenAI说计划在未来数周内推出,开发者可以先填表登记。目前想通过API接入的话,只能用Realtime API的gpt-realtime-2.1系列。

前后台解耦这步棋

我觉得GPT-Live最值得琢磨的,不是全双工本身,而是前后台解耦这个架构设计。

过去我们总希望一个模型既能秒回、又能解微积分。但"快"和"深"在算力上天然矛盾。GPT-Live的做法是干脆拆开,前台负责交互体验,后台负责推理深度。

更关键的是,后台模型是可以替换的。OpenAI官方原话说得很明确,"随着新前沿模型发布,GPT-Live会持续更新调用的模型"。今天它用GPT-5.5,明天可能就切到GPT-5.6了。前台交互体验不变,后台越来越聪明。

Sam Altman也在推文里确认了这一点。同一天,GPT-5.6系列获得美国商务部批准,将于本周四面向全球用户开放。GPT-Live发布时后台用的还是GPT-5.5,但很快就会接上更新更强的推理引擎。

这套架构还有一层长期含义。OpenAI在官方博客里写道,"这项研究将逐步解锁用语音完成更复杂、更长时程、更具Agent属性的工作"。今天它帮你查天气、做翻译,明天可能就在替你打电话办业务。

语音不再只是文字的附属品。OpenAI在把它打造成一个独立的交互入口。

安全方面呢

语音交互的特殊性在于它是实时的,传统的"事后屏蔽"根本来不及。

OpenAI这次做了几件事。一是引入了音频原生评测,专门针对自伤、情感依赖、暴力、性内容等风险领域做了红蓝对抗测试。二是实时干预机制,一旦检测到模型在输出危险内容,系统可以立刻把话头带偏、展示安全提示,或者在高风险情况下直接切断对话。

针对未成年人,他们内置了家长控制功能,并且训练了"适龄行为"直接写进模型。检测到高风险情况时,还会向关联的家长推送提醒。

至于很多人担心的声音克隆问题,OpenAI的立场很明确:GPT-Live只能用预设音色,不提供模仿真人声音的功能。

怎么用

目前GPT-Live已经开始向全球用户推送。

付费用户(Go / Plus / Pro)

默认使用 GPT-Live-1 满血版,支持 Instant / Medium / High 三个推理档位

免费用户

默认使用 GPT-Live-1 mini,核心语音交互完整,后台推理为轻量版

覆盖平台包括iOS App、Android App和ChatGPT网页版。桌面版和视频语音暂不支持,需要等后续更新。

目前每周有超过1.5亿人通过ChatGPT的语音和听写功能与AI交互。从今天起,他们打开Voice按钮的时候,会默认进入GPT-Live驱动的新体验。

如果说过去用ChatGPT语音像是在跟一个聪明的但对社交一窍不通的人打电话,现在它终于学会了一些最基本的社交直觉。知道什么时候该插话,什么时候该闭嘴,什么时候该说"嗯我听着呢"。

Sam Altman说自己从"打字派"变成了认可语音交互。坦率地讲,我自己也还是更习惯打字。但用过GPT-Live之后,至少在某些场景下,比如做饭时问菜谱、开车时查路线、散步时跟AI讨论一个想法,语音确实比打字自然得多。

AI语音花了三年,终于学会了一件事——别急着抢话。

以上。如果对你有帮助,欢迎转发。

数据来源:OpenAI官方博客、APPSO报道、IT之家