9月17日凌晨,北京已经睡了,旧金山还是下午。小米 MiMo 团队负责人罗福莉在 X 上发了一条推文,附了一个链接。
点进去的人都愣了一下。那是一个大模型的实时训练仪表盘,进度条、Token 消耗、样本数量,还有一行不断跳动的数字,训练成本。
当时两个版本已经烧掉了 128 万美元。每一小时,3 万美元。
大模型训练,第一次被全程直播。
先把判断摆在前面。小米这次真正的杀招不是 46 分本身。它是把 46 分卖出了 2 块钱的价格,还把烧钱的 6 天全程直播了出来。说白了,开源榜首正在从技术荣誉变成获客工具,而 MiMo-V2.6 是第一个把这件事做透的国产模型。
5 天后,9 月 22 日,小米正式发布并开源 MiMo-V2.6 系列。两个模型,Pro 和 Flash,都是原生全模态,文字、图片、视频、音频都能直接吃。权重挂在 Hugging Face 上,MIT 许可,下载就能商用。
上一代 V2.5 还是纯文字模型。这一代,连模态都换了。
成绩单先看。第三方评测平台 Artificial Analysis 的综合智能指数,MiMo-V2.6-Pro 拿到 46 分,登顶开源权重模型第一。Kimi K3 是 44 分,GLM-5.3 是 45 分,都被压在了下面。
更扎眼的是对比上一代。V2.5-Pro 的成绩是 26 分。从 26 到 46,版本号只涨了 0.1,分数翻了近一倍。
但 46 分这个数字,我自己看到的时候愣了一下,不是因为高,是因为它上面还有人。
总榜上排在它前面的四款,清一色闭源,其中 GPT-6 Astra 和 Fable 5.1 都是 53 分。7 分的差距,摆在那。
开源和闭源旗舰之间这 7 分,本质上是算力账,不是路线账。高盛测算,这次训练用了约 4000 到 8000 个 H200 等效 GPU。347 万美元,买 20 分的涨幅。这笔账算得过来,差距就填得上。
| MiMo-V2.6 关键数字 | 数据 |
|---|---|
| AA 综合智能指数 | 46 分,开源第一(上一代 26 分) |
| RL 训练总成本 | 超 347 万美元(Pro 262 万+Flash 85 万) |
| 训练时长与规模 | 不到 6 天,各 30 步,累计约 75 万条轨迹 |
| DeepSWE v1.1 提升 | Flash 48.8→65.68,Pro 58.4→72.57 |
| API 定价(每百万 token) | Pro 输入 3 元/输出 6 元,Flash 输入 1 元/输出 2 元 |
| 单任务成本 | 0.13 美元,约为海外模型的 1/20 至 1/60 |
347 万美元这个数字值得拆开看。不到 6 天,Pro 烧了约 262 万美元,Flash 烧了约 85 万美元,各跑了 30 步强化学习,累计约 75 万条轨迹。
回报是实打实的。训练任务的平均通过率,Flash 相对提升 25%,Pro 提升 12%。样本外的长程软件工程评测 DeepSWE v1.1,Flash 从 48.8 涨到 65.68,Pro 从 58.4 涨到 72.57。
坦率地讲,6 天 347 万美元,买的是"强化学习究竟能走多远"这个问题的答案。罗福莉在发布时就把问题摆在了台面上。
而真正让我觉得狠的,是直播本身。
9 月 17 日那个实时页面,公开的不只是成本和进度。训练中途的干预记录也都在上面,基建错误重跑、不良模式数据集、零梯度任务、GPU 显存不足。连翻车现场都直播。
RL 训练直播,注定会变成大厂的军备竞赛。谁先公开,谁就定义了技术自信的标准。
在国内大模型厂商里,这是第一次。以前大家只晒成绩单,小米这次把草稿纸也贴出来了。
再看价格。MiMo-V2.6 沿用了上一代的 API 定价,Pro 每百万 token 输入 3 元、输出 6 元,Flash 输入 1 元、输出 2 元。
单任务成本 0.13 美元。同等智能水平下,价格是海外模型的二十分之一到六十分之一。小米自己说的,第一次把全球前沿智能带入 0.1 美元成本区间。
每个月底被 API 账单刺痛过的开发者,看到 1/60 这个数字,心头都会动一下。
说白了,小米是在用 1/60 的价格,给自家 Agent 生态买流量入口。模型发布同一天,MiMo Desktop 桌面客户端正式版上线,还推了会员订阅。Pro 还有个 UltraSpeed 超高速模式,输出速度最高能到 20 倍。
模型、桌面端、订阅、高速模式,一套组合拳。开源的 46 分,是这套拳的拳头。
当然,冷静的话也要说在前面。小米自己公布的评测表里,Pro 并不是全胜。ProgramBench 上 26.5 分,Claude Opus 5 是 37 分。Terminal Bench 4.0,34.9 对 49。AI 前线的第三方实测结论是,很惊艳,但也有幻觉。
还有那两个科研案例。MOF 材料设计,把研发周期从约一个月压缩到 2 到 3 天。Lean 4 里完成《周期三蕴含混沌》的形式化证明,6000 多行源码全部通过内核核验。听起来很科幻,但两次都是研究人员多轮提示、设计流程、筛选结果之后做成的。
它证明的是科研辅助的潜力,离独立做科研还差得远。把辅助说成自主,就是另一种浮夸。
罗福莉在 X 上写了一句话,我印象很深。"在我看来,它背后的研究创新和工程挑战超过了 DeepSeek R1,后者我曾部分参与。"
她是 DeepSeek 出来的,R1 她参与过。现在她说,新东家的活,难度超过了老东家。这话的锐气,隔着屏幕都能感觉到。
市场都在欢呼 46 分登顶,但我有一个反共识的判断。分数只是热搜,MiMo-V2.6 真正值钱的东西,是那 7000 个开源的 RL 训练任务环境。
分数决定的是这周的热搜,环境决定的是未来一年谁还能追上来。小米这次开源的不只是两个模型权重,还有蒸馏版、端到端 RL 训练框架、轻量 Agent 框架。同行拿回去,是可以直接开工的。
分歧变量只有一个,第三方团队用这套开源框架复现出接近成绩的速度。
证伪条件我也摆出来,如果 3 个月内没有第三方团队基于这套环境训出有竞争力的模型,那我这个判断就是错的。
再往前看一步。小米的模型发布已经进入季度节奏,3 月 V2-Pro,4 月 V2.5 开源,5 月降价,6 月 MiMo Code,9 月 V2.6。按这个节奏,下一版不会太远。
开源榜首这个位置,现在成了明牌的军备竞赛。Kimi、Qwen、DeepSeek,每一家都要接招。而"智能×成本"的帕累托前沿每被推进一次,Agent 应用的成本门槛就降一截。最终受益的,是每一个用模型干活的人。
如果你正在选开源模型,记住三个判断标准。
第一,看 AA 指数能不能稳定在开源前三,单次登顶说明不了问题。
第二,看单任务成本,记住 0.13 美元这个数字,超过 0.2 美元还自称便宜的,都是伪命题。
第三,看有没有第三方实测背书,官方榜单永远只看一半。
46 分是热搜。2 块钱是生意。
你会为了 1/60 的价格换模型吗?评论区聊聊你的判断。
觉得有用,转发给还在为 API 账单肉疼、想试试小米开源模型的朋友。建议收藏,下次选模型的时候对照那三个标准。
更多AI产业深度观察,关注专业网站 犀牛伯爵 rhinocount.cn
谢谢你看我的文章。