6天烧掉2000万,小米直播炼大模型

2026年9月23日 · 阅读时间约5分钟
文|犀牛伯爵

9月17日凌晨,北京已经睡了,旧金山还是下午。小米 MiMo 团队负责人罗福莉在 X 上发了一条推文,附了一个链接。

点进去的人都愣了一下。那是一个大模型的实时训练仪表盘,进度条、Token 消耗、样本数量,还有一行不断跳动的数字,训练成本。

当时两个版本已经烧掉了 128 万美元。每一小时,3 万美元。

大模型训练,第一次被全程直播。

先把判断摆在前面。小米这次真正的杀招不是 46 分本身。它是把 46 分卖出了 2 块钱的价格,还把烧钱的 6 天全程直播了出来。说白了,开源榜首正在从技术荣誉变成获客工具,而 MiMo-V2.6 是第一个把这件事做透的国产模型。

5 天后,9 月 22 日,小米正式发布并开源 MiMo-V2.6 系列。两个模型,Pro 和 Flash,都是原生全模态,文字、图片、视频、音频都能直接吃。权重挂在 Hugging Face 上,MIT 许可,下载就能商用。

上一代 V2.5 还是纯文字模型。这一代,连模态都换了。

成绩单先看。第三方评测平台 Artificial Analysis 的综合智能指数,MiMo-V2.6-Pro 拿到 46 分,登顶开源权重模型第一。Kimi K3 是 44 分,GLM-5.3 是 45 分,都被压在了下面。

更扎眼的是对比上一代。V2.5-Pro 的成绩是 26 分。从 26 到 46,版本号只涨了 0.1,分数翻了近一倍。

Artificial Analysis综合智能指数榜单,MiMo-V2.6-Pro以46分登顶开源第一
图源|IT PRO Magazine 2026-09-22

但 46 分这个数字,我自己看到的时候愣了一下,不是因为高,是因为它上面还有人。

总榜上排在它前面的四款,清一色闭源,其中 GPT-6 Astra 和 Fable 5.1 都是 53 分。7 分的差距,摆在那。

开源和闭源旗舰之间这 7 分,本质上是算力账,不是路线账。高盛测算,这次训练用了约 4000 到 8000 个 H200 等效 GPU。347 万美元,买 20 分的涨幅。这笔账算得过来,差距就填得上。

MiMo-V2.6 关键数字数据
AA 综合智能指数46 分,开源第一(上一代 26 分)
RL 训练总成本超 347 万美元(Pro 262 万+Flash 85 万)
训练时长与规模不到 6 天,各 30 步,累计约 75 万条轨迹
DeepSWE v1.1 提升Flash 48.8→65.68,Pro 58.4→72.57
API 定价(每百万 token)Pro 输入 3 元/输出 6 元,Flash 输入 1 元/输出 2 元
单任务成本0.13 美元,约为海外模型的 1/20 至 1/60
数据来源|小米官方发布、21世纪经济报道、高盛研报综合整理

347 万美元这个数字值得拆开看。不到 6 天,Pro 烧了约 262 万美元,Flash 烧了约 85 万美元,各跑了 30 步强化学习,累计约 75 万条轨迹。

回报是实打实的。训练任务的平均通过率,Flash 相对提升 25%,Pro 提升 12%。样本外的长程软件工程评测 DeepSWE v1.1,Flash 从 48.8 涨到 65.68,Pro 从 58.4 涨到 72.57。

坦率地讲,6 天 347 万美元,买的是"强化学习究竟能走多远"这个问题的答案。罗福莉在发布时就把问题摆在了台面上。

而真正让我觉得狠的,是直播本身。

9 月 17 日那个实时页面,公开的不只是成本和进度。训练中途的干预记录也都在上面,基建错误重跑、不良模式数据集、零梯度任务、GPU 显存不足。连翻车现场都直播。

RL 训练直播,注定会变成大厂的军备竞赛。谁先公开,谁就定义了技术自信的标准。

在国内大模型厂商里,这是第一次。以前大家只晒成绩单,小米这次把草稿纸也贴出来了。

再看价格。MiMo-V2.6 沿用了上一代的 API 定价,Pro 每百万 token 输入 3 元、输出 6 元,Flash 输入 1 元、输出 2 元。

单任务成本 0.13 美元。同等智能水平下,价格是海外模型的二十分之一到六十分之一。小米自己说的,第一次把全球前沿智能带入 0.1 美元成本区间。

Artificial Analysis单任务成本榜单,MiMo-V2.6-Pro单任务成本0.13美元
图源|IT PRO Magazine 2026-09-22

每个月底被 API 账单刺痛过的开发者,看到 1/60 这个数字,心头都会动一下。

说白了,小米是在用 1/60 的价格,给自家 Agent 生态买流量入口。模型发布同一天,MiMo Desktop 桌面客户端正式版上线,还推了会员订阅。Pro 还有个 UltraSpeed 超高速模式,输出速度最高能到 20 倍。

模型、桌面端、订阅、高速模式,一套组合拳。开源的 46 分,是这套拳的拳头。

当然,冷静的话也要说在前面。小米自己公布的评测表里,Pro 并不是全胜。ProgramBench 上 26.5 分,Claude Opus 5 是 37 分。Terminal Bench 4.0,34.9 对 49。AI 前线的第三方实测结论是,很惊艳,但也有幻觉。

还有那两个科研案例。MOF 材料设计,把研发周期从约一个月压缩到 2 到 3 天。Lean 4 里完成《周期三蕴含混沌》的形式化证明,6000 多行源码全部通过内核核验。听起来很科幻,但两次都是研究人员多轮提示、设计流程、筛选结果之后做成的。

它证明的是科研辅助的潜力,离独立做科研还差得远。把辅助说成自主,就是另一种浮夸。

罗福莉在 X 上写了一句话,我印象很深。"在我看来,它背后的研究创新和工程挑战超过了 DeepSeek R1,后者我曾部分参与。"

她是 DeepSeek 出来的,R1 她参与过。现在她说,新东家的活,难度超过了老东家。这话的锐气,隔着屏幕都能感觉到。

市场都在欢呼 46 分登顶,但我有一个反共识的判断。分数只是热搜,MiMo-V2.6 真正值钱的东西,是那 7000 个开源的 RL 训练任务环境。

分数决定的是这周的热搜,环境决定的是未来一年谁还能追上来。小米这次开源的不只是两个模型权重,还有蒸馏版、端到端 RL 训练框架、轻量 Agent 框架。同行拿回去,是可以直接开工的。

分歧变量只有一个,第三方团队用这套开源框架复现出接近成绩的速度。

证伪条件我也摆出来,如果 3 个月内没有第三方团队基于这套环境训出有竞争力的模型,那我这个判断就是错的。

再往前看一步。小米的模型发布已经进入季度节奏,3 月 V2-Pro,4 月 V2.5 开源,5 月降价,6 月 MiMo Code,9 月 V2.6。按这个节奏,下一版不会太远。

开源榜首这个位置,现在成了明牌的军备竞赛。Kimi、Qwen、DeepSeek,每一家都要接招。而"智能×成本"的帕累托前沿每被推进一次,Agent 应用的成本门槛就降一截。最终受益的,是每一个用模型干活的人。

如果你正在选开源模型,记住三个判断标准。

第一,看 AA 指数能不能稳定在开源前三,单次登顶说明不了问题。

第二,看单任务成本,记住 0.13 美元这个数字,超过 0.2 美元还自称便宜的,都是伪命题。

第三,看有没有第三方实测背书,官方榜单永远只看一半。

46 分是热搜。2 块钱是生意。

你会为了 1/60 的价格换模型吗?评论区聊聊你的判断。

觉得有用,转发给还在为 API 账单肉疼、想试试小米开源模型的朋友。建议收藏,下次选模型的时候对照那三个标准。

更多AI产业深度观察,关注专业网站 犀牛伯爵 rhinocount.cn

谢谢你看我的文章。