你有没有过这种体验。正在跟ChatGPT语音聊天,说到一半稍微停顿了一下组织语言,它就急着接话了。或者旁边路过一辆公交车,引擎声刚响,它就以为你说完了,直接开始输出一大段。
整个交流过程就像一场严格遵循"你一句、我一句"规则的对口相声。但对方是个没有情商的搭档,不管你的气口在哪儿,它都按自己的节奏来。
北京时间今天凌晨,OpenAI发布了新一代语音模型GPT-Live。用Sam Altman自己的话说,"感觉很神奇、很真实",还发了条推表示自己一直更喜欢打字,但这件事要变了。
说实话我一开始也没太当回事。语音模型的升级又不是第一次了。但看完官方博客和评测数据之后,我觉得这次可能真的不太一样。
要理解GPT-Live做了什么,得先回顾一下AI语音经历过的三代架构。
打个比方。第一代像写信,来回一趟要好几天。第二代像对讲机,你说完按按钮它才能回。第三代终于像打电话了,双方可以同时说话,抢话、插话、沉默,都处理得自然。
这个"像打电话"的体验,来自两个底层架构变化。第一个叫持续交互(Continuous Interaction)。GPT-Live不是把你每句话当成一个独立输入来处理,而是在持续处理音频流的同时持续生成音频输出。模型每秒可以做很多次交互决策,是该说话、该继续听、该停顿、该打断、还是该调用工具。
第二个变化更绝。叫异步委托(Delegation)。
怎么说呢,你可以把GPT-Live理解成一个"前台接待"。它负责跟你聊天、接话、垫话、让你感觉舒适。但如果你的问题需要联网搜索、深度推理或者执行复杂任务,它会在后台悄悄把活儿"外包"给另一个模型。首批上线时,这个后台模型是GPT-5.5。
最巧妙的地方在于,后台模型吭哧吭哧算的时候,前台并不闲着。它会继续用自然的语音跟你保持互动,不会让你觉得冷场。等后台算完了,它再把结果无缝融入对话。
当你问了一个需要搜索的复杂问题,GPT-Live可以先跟你说"这个问题挺有意思,让我查一下",然后继续用语音跟你闲聊或者补充背景,直到答案准备好。
官方博客列了几个具体的能力提升,我挑最值得说的讲。
学会了"垫话"。当你在长篇大论的时候,GPT-Live不会再一声不吭地等你。它会适时发出"嗯嗯"、"对"、"明白"这样的语气词。别小看这个功能,这是人类对话中最基础但最被忽视的社交信号。你跟一个人说话,对方全程面无表情一声不吭,哪怕他在认真听,你也会觉得不舒服。
懂得了"闭嘴"。如果你说话卡壳了,或者直接说"让我想一下",它会安静等你。之前的AVM基于静音检测来判断你是否说完,你一停它就抢话。GPT-Live能区分"停顿思考"和"说完",不会在你不该被打断的时候插嘴。
抗干扰能力升级。走在马路上旁边有人说话、或者办公室里有背景噪音,它更能锁定你的声音而非被噪音带偏。
实时双向翻译。这是全新的能力。你这边说着中文,它可以同声翻译成英文说出去,两种语言在同一条对话里无缝交错。这对跨语言场景来说确实很实用。
可视化卡片。语音对话中,如果你问了天气、股票、体育比分这类信息,它会在屏幕上弹出视觉卡片,不用你单独打开App去看。
语速可调。跟它说"说慢一点",它不会像以前那样机械地降速播放,而是重新组织语序并插入自然的停顿。
OpenAI还为GPT-Live重新调整了ChatGPT里9个预设音色的声音表现力。付费用户可以选择三个推理强度档位,Instant适合要快的问题,Medium和High适合需要深度思考的场景。免费用户则默认使用GPT-Live-1 mini,核心交互能力完整,后台推理用轻量版。
官方做了盲测。测试者与模型进行5到10分钟的连续对话,然后在两版语音之间做选择。结果挺夸张的。
图源:OpenAI官方博客
BrowseComp这个数据最让我注意。上一代AVM只有0.7%的准确率,基本上等于不会用。GPT-Live直接飙到75.2%,从不可用跨越到了能干活的水平。这主要归功于异步委托机制,后台GPT-5.5帮你搜索和推理,前台GPT-Live把结果用语音自然地说出来。
GPQA测试的是物理、化学、生物领域的专家级推理。在High推理档位下,GPT-Live拿到了84.2%的准确率,接近上一代的两倍。
说完了好的,说说目前还不太行的地方。
桌面版暂未更新。截至今天,新版语音体验只覆盖了iOS、Android和网页端。桌面App还没同步,需要继续用旧版。
不支持视频和屏幕共享。首发阶段,如果你需要对着屏幕或者视频跟ChatGPT语音交互,得切回Legacy Voice。
多语言口音问题。OpenAI说GPT-Live只针对ChatGPT上最热门的几种语言做了充分优化。某些语言下可能带着"外国口音"或者偶尔词不达意。他们表示在加紧改进。
推理档位需要手动选。Instant、Medium、High三个档位得你自己判断用哪个。有时候你也不知道问题到底需要多深的推理,选错了要么白等要么质量不够。
API还没开放。GPT-Live-1的API暂未上线,OpenAI说计划在未来数周内推出,开发者可以先填表登记。目前想通过API接入的话,只能用Realtime API的gpt-realtime-2.1系列。
我觉得GPT-Live最值得琢磨的,不是全双工本身,而是前后台解耦这个架构设计。
过去我们总希望一个模型既能秒回、又能解微积分。但"快"和"深"在算力上天然矛盾。GPT-Live的做法是干脆拆开,前台负责交互体验,后台负责推理深度。
更关键的是,后台模型是可以替换的。OpenAI官方原话说得很明确,"随着新前沿模型发布,GPT-Live会持续更新调用的模型"。今天它用GPT-5.5,明天可能就切到GPT-5.6了。前台交互体验不变,后台越来越聪明。
Sam Altman也在推文里确认了这一点。同一天,GPT-5.6系列获得美国商务部批准,将于本周四面向全球用户开放。GPT-Live发布时后台用的还是GPT-5.5,但很快就会接上更新更强的推理引擎。
这套架构还有一层长期含义。OpenAI在官方博客里写道,"这项研究将逐步解锁用语音完成更复杂、更长时程、更具Agent属性的工作"。今天它帮你查天气、做翻译,明天可能就在替你打电话办业务。
语音不再只是文字的附属品。OpenAI在把它打造成一个独立的交互入口。
语音交互的特殊性在于它是实时的,传统的"事后屏蔽"根本来不及。
OpenAI这次做了几件事。一是引入了音频原生评测,专门针对自伤、情感依赖、暴力、性内容等风险领域做了红蓝对抗测试。二是实时干预机制,一旦检测到模型在输出危险内容,系统可以立刻把话头带偏、展示安全提示,或者在高风险情况下直接切断对话。
针对未成年人,他们内置了家长控制功能,并且训练了"适龄行为"直接写进模型。检测到高风险情况时,还会向关联的家长推送提醒。
至于很多人担心的声音克隆问题,OpenAI的立场很明确:GPT-Live只能用预设音色,不提供模仿真人声音的功能。
目前GPT-Live已经开始向全球用户推送。
默认使用 GPT-Live-1 满血版,支持 Instant / Medium / High 三个推理档位
默认使用 GPT-Live-1 mini,核心语音交互完整,后台推理为轻量版
覆盖平台包括iOS App、Android App和ChatGPT网页版。桌面版和视频语音暂不支持,需要等后续更新。
目前每周有超过1.5亿人通过ChatGPT的语音和听写功能与AI交互。从今天起,他们打开Voice按钮的时候,会默认进入GPT-Live驱动的新体验。
如果说过去用ChatGPT语音像是在跟一个聪明的但对社交一窍不通的人打电话,现在它终于学会了一些最基本的社交直觉。知道什么时候该插话,什么时候该闭嘴,什么时候该说"嗯我听着呢"。
Sam Altman说自己从"打字派"变成了认可语音交互。坦率地讲,我自己也还是更习惯打字。但用过GPT-Live之后,至少在某些场景下,比如做饭时问菜谱、开车时查路线、散步时跟AI讨论一个想法,语音确实比打字自然得多。
AI语音花了三年,终于学会了一件事——别急着抢话。