7月30日,OpenAI把GPT-5.6 Luna的价格砍了80%。输入从每百万Token 1美元直接掉到0.2美元,输出从6美元掉到1.2美元。四天后,8月4号,GPT-Live的系统架构图悄无声息地挂在一篇技术博客上。
所有人都在喊价格战。说OpenAI在绞杀DeepSeek,在挤压Kimi,在跟Gemini拼刺刀。
没人把这两件事连起来看。
但我越看GPT-Live那张架构图,越觉得后背发凉。Luna降价80%跟价格战没什么关系。它是给GPT-Live铺的管道。
先把时间线捋清楚。
五天之内,三步棋。先降价,再加水印,最后亮架构图。你觉得这是巧合?
我自己的感受是,这三步棋有一个共同的目标,只是大部分人还没看到。
GPT-Live最狠的一刀,不是延迟从几秒压到0.3秒,也不是把Python换成了Go。是它把声音和脑子分了家。
以前的语音AI,不管是Siri还是早期的ChatGPT Voice,逻辑都是"你一句我一句"。你说完,它开始想,想完了再开口。中间那段沉默,短则一两秒,长到让你以为断线了。
GPT-Live的架构完全不一样。人声进来,走一条超轻量的通道,语音模型实时回应。需要查资料、跑代码、做复杂推理的时候,它不自己干,而是委托给背后的文字模型去跑。
"用户说话,音频进Media Frontend,语音模型实时回应,需要深度推理的时候委托给GPT-5.5文本模型去跑工具,跑完结果回来,语音继续,不中断。"
这段描述看着平平无奇,但你仔细想一下里面藏着什么。
每次语音对话,只要碰到需要推理的问题,就会触发一次文字模型的API调用。用户问"帮我查一下这家公司的财报",语音模型自己答不了,它得把这个问题丢给GPT-5.5去跑搜索、跑代码、跑工具。跑完了,结果回来,语音模型再用人话说给你听。
一次语音对话,可能触发三四次甚至七八次文字模型调用。用户只说了一句话,后台的API账单翻了好多倍。
现在你想一下,ChatGPT有1.5亿周活用户。如果这1.5亿人里有哪怕三分之一开始频繁用语音交互,背后的文字API调用量会是什么量级?
这不是线性增长,是指数爆炸。
回到Luna降价这件事。
Luna是GPT-5.6系列里最便宜的那档,定位是分类、抽取、RAG召回、Agent子步骤这些轻量任务。根据OpenAI自己披露的数据,Luna占了企业API调用量的80%。
你再看看GPT-Live的委托逻辑。语音模型把复杂任务委托给文字模型,但不是每次委托都需要最强的Sol。大部分时候,分类一下用户意图、抽取一下关键信息、跑一个简单的工具调用,Luna就够了。
也就是说,GPT-Live每触发一次文字模型调用,最可能命中的就是Luna。
| 模型 | 旧价(输入/输出,每百万Token) | 新价 | 降幅 |
|---|---|---|---|
| GPT-5.6 Luna | $1.00 / $6.00 | $0.20 / $1.20 | -80% |
| GPT-5.6 Terra | $2.50 / $15.00 | $2.00 / $12.00 | -20% |
| GPT-5.6 Sol | $5.00 / $30.00 | 不变(新增Fast: $10/$60) | 0% |
如果Luna不降价,每次语音对话背后的文字调用成本会让OpenAI自己先扛不住。1.5亿用户,每人每天聊十来分钟语音,每个语音对话触发三四次Luna调用,你算算一天要烧多少钱。
但Luna降到原来的五分之一之后,这笔账就完全不一样了。OpenAI内部把Auto Review从GPT-5.4切到Luna,官方说成本降了约10倍。10倍。这不是降价让利,这是在给自己的下一代产品清成本障碍。
说真的,我一开始也以为这就是价格战。Luna降价后比DeepSeek V4 Flash还便宜,比Claude Haiku 4.5低一大截,直接把价格敏感的开发者锁在OpenAI生态里。这个判断没错,但只看到了表层。
深层的原因是,OpenAI需要文字推理便宜到可以忽略不计,因为GPT-Live要让文字模型当"隐形工人"。工人越多,工资得越低,不然项目赔本。
再往深看一层。GPT-Live的技术选型,每一步都在为"语音成为主要交互方式"做准备。
团队把原来那套Python asyncio的传输层全换成了Go。原话是"Python跑语音,像用算盘打电竞"。Go一上,帧率稳了,1.5亿周活用户的抖动率掉了一半不止。
然后是WARP协议。原来的WebRTC要来回跑六趟握手才能建立连接,WARP把它砍成一发子弹,单包直送。打开App,点语音键,0.3秒就通。
还有每秒七八次的状态判断。该听?该说?该停?还是让你直接插嘴?系统不是在"等你讲完",而是"边听边想边组织语言"。你中途打断说"等等,其实我想问",它真能刹住,重听,改口,连呼吸节奏都不乱。
这些技术细节单独看,每一项都是工程优化。放在一起看,是在造一个东西,一个让人忘记打字的语音交互层。
你一句我一句,中间沉默2-3秒。复杂问题直接卡死或黑屏重连。Python底层,抖动率高。WebRTC六步握手,连接慢。用户用完一次就不想用第二次。
边听边说,延迟0.3秒。复杂问题后台委托GPT-5.5,语音层不中断。Go底层,抖动率降一半。WARP单包直送,秒连。可随时打断改口,像真人对话。
你想想,当语音交互的体验好到跟真人聊天差不多,谁还愿意打字?
打字要切输入法,要纠错,要想措辞。说话只需要张嘴。门槛差了一个数量级。
目前中文互联网上关于Luna降价的分析,基本都落在"价格战"这个框里。逻辑很直接,DeepSeek把价格打下来了,OpenAI不得不跟。Luna降到比DeepSeek还便宜,是为了把价格敏感的开发者拉回来。
这个逻辑不能说错,但太窄了。
如果只是为了打价格战,为什么Sol不降?Sol是GPT-5.6系列里最强的那个,定价5美元/30美元,一分没动,反而加了个Fast模式收两倍钱。你打价格战会把主力旗舰的价格守住不动,只砍最便宜的那档?
如果你真的在跟DeepSeek抢开发者,你应该降Sol,因为Sol才是开发者在意的性能标杆。降Luna只会让人觉得你在抢低端市场。
但如果你是为了给GPT-Live铺管道,一切就说得通了。Luna是GPT-Live背后那个"隐形工人"最可能用到的模型。降Luna就是降低语音交互的幕后成本。Sol不降,因为Sol本来就不是干苦力的,它是卖速度卖上限的,跟语音管道没关系。
还有一个细节。OpenAI披露Sol参与了重写生产GPU kernel,端到端服务成本降了约20%,Token生成效率提了15%以上。这说明OpenAI的推理成本确实在下降。但降了20%的成本,却把Luna降了80%,中间差的60%去哪了?
答案是,OpenAI主动放弃了Luna这层的利润。不是因为它大方,是因为它需要Luna的用量上去。用量上不去,GPT-Live的管道就白铺了。
怎么说呢,这事儿吧,跟AWS当年的策略一模一样。亚马逊把EC2的算力价格压到地板,不是为了当慈善家,是为了让所有人都在AWS上建应用。等你建完了,迁移成本就比那点差价贵一百倍。
OpenAI现在干的是同一件事。把文字推理的价格压到地板,让所有开发者的Agent工作流都跑在Luna上。等GPT-Live把语音交互的体验做到极致,开发者会自然地把自己的Agent接上语音层。到那时候,你的整个应用栈都在OpenAI上面了。
所有人都在讨论Luna降价对DeepSeek、Kimi、Qwen的冲击。说老实话,这些模型公司反而是最不需要担心的。
DeepSeek有成本优势,Kimi有开源生态,Qwen有阿里的云分发。它们各有各的护城河,Luna降价会让它们难受一阵子,但不会致命。
真正会被干掉的,是那些做语音AI的创业公司。
你想想,GPT-Live出现之前,语音AI是一个独立的赛道。有人做语音识别,有人做语音合成,有人做对话管理,有人做实时推理优化。这些公司各自有自己的技术壁垒,融了不知道多少钱。
然后OpenAI一脚把整条赛道踹翻了。
GPT-Live不是在某个环节做得更好,它是把整条链路全吃进去了。从语音输入到实时对话到深度推理到语音输出,一个系统全搞定。延迟0.3秒,可打断,可插嘴,背后还能调GPT-5.5跑工具。而且免费给ChatGPT用户用。
你是一个做语音AI的创业公司CEO,你看到这个架构图,你心里是什么感受?
我有时候觉得,OpenAI最可怕的不是技术领先,是它总能在一个赛道眼看要起来的时候,直接把赛道本身给取消掉。你准备了三年的商业计划书,人家一个技术博客就给作废了。
我自己的判断是,GPT-Live加上Luna降价这组合拳,会在未来六个月内引发三件事。
第一,语音优先的AI应用会爆发。以前开发者不敢做语音交互,因为延迟太高、成本太贵、体验太差。现在这三个问题一次性解决了。延迟0.3秒,Luna调用成本只有原来的五分之一,体验接近真人对话。会有一批"只会说话不会打字"的AI产品冒出来。
第二,文字API会变成看不见的基础设施。就像水电煤一样,你不会关心电是从哪个电厂来的,你只会关心灯亮不亮。开发者不会再纠结用Luna还是DeepSeek,因为价格已经低到不值得纠结了。竞争的焦点会从"谁的模型便宜"转到"谁的语音体验好"。
第三,交互层的定价权会成为新的战场。Luna可以白送,但GPT-Live的语音交互层不会。150M周活用户习惯语音交互之后,OpenAI会在那个层收费。月费、按分钟计费、企业版,花样多的是。文字模型赚的是流水,语音交互层赚的才是利润。
可能有些想法还不成熟,但大方向我比较确定。文字推理正在变成基础设施,就像十年前云存储变成基础设施一样。当年AWS把存储价格压到地板,大家以为亚马逊疯了。后来才看明白,它不是在卖存储,它是在卖构建在存储之上的整个生态。
OpenAI现在干的是同一件事。Luna是存储,GPT-Live是EC2。
如果你是开发者,我的建议很简单。别再纠结用哪个模型便宜了。Luna已经比DeepSeek还便宜,再省也省不出多少。把精力放到语音交互的设计上,放到Agent工作流和语音的结合上。
打字的时代在收尾。不是明天就不打字了,但趋势已经很明显。语音交互的体验拐点已经到了,0.3秒延迟、可打断、可插嘴、后台有GPT-5.5做苦力。这些条件凑齐的那一刻,就是语音从"锦上添花"变成"主要入口"的起点。
回到开头那个问题。Luna砍80%是不是价格战?
是,但不只是。价格战是表层,管道是里层。OpenAI在用低价把所有人拉进它的文字推理生态,同时用GPT-Live把语音交互的体验做到无法拒绝。等你反应过来的时候,你的用户、你的数据、你的Agent工作流,全都在它的管道里跑着。
管道这个东西,修的时候没人注意。等水流进来了,你想换一条已经来不及了。
谢谢你看我的文章。
本文事实来源:OpenAI官方定价页面、GPT-Live技术博客、Greg Brockman X平台发布、AI HOT精选数据。文中关于OpenAI战略意图的分析为作者个人判断,可能存在偏差。