
9 月 17 日,小米 MiMo 大模型负责人罗福莉发文称,自 4 月开源 MiMo-v2.5 之后,团队沉寂了近半年,只钻研了一件事:强化学习究竟能扩展到多远。目前 MiMo-V2.6 正处于强化学习中间阶段,小米干脆把训练过程做成了直播,训练总花费已超 125 万美元(约合 840.3 万元人民币),直播页面显示模型即将推出。
沉寂半年,赌一条 RL 路线
预训练烧钱、追赶困难的局面下,行业近一年的共识逐渐清晰:能力提升的第二曲线在强化学习与智能体训练上。小米这半年的沉默,基本可以理解为在这条线上憋动作。罗福莉把问题问得很直白,强化学习究竟能扩展到多远。这句话背后对应的是一组具体的工程问题:算力怎么扩、环境怎么多、奖励怎么评。MiMo-V2.6 的进展,恰好是对这三问的逐条作答。
三项扩展,把 RL 的地基加宽
按披露信息,MiMo-V2.6 在三个维度同时扩展。计算层面,每步约 20 亿个 Token,由 1568 个 Prompt 各 16 条 Rollout 构成,且完全异步,这个规模在开源阵营里算得上有分量。环境与工具层面,做的是多任务智能体强化学习,一次运行中混合多个框架,意味着模型不再是单一任务的答题者,而是在多种环境里反复试错、积累通用能力。
第三项 Grader Compute 最有意思:给打分和评分过程本身增加算力,包含测试案例和评分标准奖励,采用 Agentic In-group Credit Assignment。换句话说,评分器这个常被忽视的环节,也被正式当成需要算力喂养的关键部件。团队还承诺在接下来几周内逐步开源这些细节。对一个复现门槛极高的方向来说,公开工程细节的价值可能超过单纯放出权重。
把训练变成直播,是个聪明的动作
训练花费超 125 万美元,单看这个数字谈不上惊人,敢放在直播页面上滚动展示才是重点。大模型训练成本向来是黑箱,厂商只愿意在发布会讲「我们投入了多少」,把实时账单挂出来,等于把过程透明化交给公众。围观者既能看到训练曲线,也能对资金使用效率形成自己的判断。这种做法的直接收益是信任,间接收益是传播,一场直播抵得过几次预热海报。
写在最后
小米在 AI 上的姿态一直务实:不追风口叙事,按自己的节奏半年憋一版。MiMo-V2.6 的三项扩展都打在强化学习的基础设施上,比单纯的参数竞赛更扎实。当然,直播页的「即将推出」还没给出具体时间,模型成色也要等发布后的第三方评测说话。至少这份公开的账单和承诺的开源细节,让它在发布之前就先赢回了一些信任。
配图说明:本文封面为 AI 生成图像。
参考:IT之家《小米直播训练 MiMo-V2.6 模型,罗福莉称沉寂半年钻研一件事》报道,本文为基于公开信息的独立评述。