罗福莉也学雷军玩直播,小米新模型训练首次公开,一小时狂烧20万
- 行业趋势
- 3条评论
就在刚才,小米 MiMo 团队对外披露了他们的新动态。
小米 MiMo 团队负责人罗福莉在 X 平台发文称,过去约半年时间里,团队一直聚焦于一个核心议题:强化学习(RL)究竟能拓展到何种程度。
她指出,目前 MiMo-V2.6 正处在 RL 训练阶段,团队正从三个维度扩大规模,即计算资源、训练环境与任务体系,以及奖励评估机制。未来数周,小米 MiMo 团队会逐步公布更多技术详情。
直播链接 https://mimo.xiaomi.com/rl/#overview
与此同时,罗福莉还公开了 MiMo-V2.6 的实时训练界面,让外界首次得以一窥该代模型在强化学习阶段的部分训练状况。
根据罗福莉公开的训练界面,MiMo-V2.6 当前正进行一场大规模 Agent 强化学习实验。界面展示了模型训练进度、Token 消耗、训练成本、样本数量及多项内部指标的变化。
目前训练界面包含两个版本,分别为 MiMo-V2.6-Pro 和 MiMo-V2.6-Flash。
其中,MiMo-V2.6-Pro 当前处于 step 12 阶段,累计训练样本约 301K,训练成本约 806,349 美元,累计消耗 Token 达 25.1B。
MiMo-V2.6-Flash 当前处于 step 17 阶段,累计训练样本约 426K,训练成本约 354,499 美元,累计消耗 Token 达 40.5B。
两个版本当前累计训练成本已超过 116 万美元,平均每小时计算成本约达 3.09 万美元(折合人民币 20.72 万元)。 不过,从训练面板数据看,小米此次公开的重点并非成本,而是展示 RL 训练过程中模型如何借助大规模任务交互持续提升能力。
MiMo-V2.6 正挑战 RL 的规模极限
罗福莉在 X 平台提到,MiMo-V2.6 本轮强化学习训练重点聚焦于扩大三个方向。
第一个方向是计算规模。
她表示,团队将单个训练 step 的规模提升至约 2B tokens,同时采用 1568 个 prompts × 16 rollouts 的训练模式,并使用 fully async,即完全异步训练。
按此配置计算,单个训练 step 理论上会产生约 2.5 万次模型尝试,相当于让 AI 同步探索大量不同的解决路径。
在此训练模式下,模型面对一项任务时,不会仅生成一次答案,而是会同时尝试多种解决方案,再依据奖励反馈判断哪些路径更为有效。
对 Agent 模型而言,大规模探索能力至关重要。以往的大模型更多依赖预训练获取知识,再通过监督微调调整输出方式。
但当 AI 开始承担编程、办公、资料分析等复杂任务后,模型所需的不只是回答问题,还需规划步骤、调用工具、验证结果。
强化学习的价值,在于让模型通过大量尝试和反馈,逐步形成更有效的任务执行策略。
第二个方向是训练环境。罗福莉表示,团队扩大了 environments 和 harnesses,引入 multi-task agentic RL,将多个任务环境混合到一次训练流程中。
从 MiMo-V2.6 实时监控面板显示的数据来看,当前训练任务覆盖视觉、代码、通用任务以及聊天任务。
界面中可见 visual/dataset-jz3d、visual/dataset-gtaV、visual/dataset-vs3e 等视觉数据集,也包含 code/dataset-4qn 等代码任务,以及 general、chat 类数据集。
这意味着 MiMo-V2.6 并非只优化单一能力,而是在尝试让模型同时适应不同类型的 Agent 场景。
第三个方向是增加评判系统的计算投入。
罗福莉提到,团队引入了 agentic in-group credit assignment,并结合 test-case 和 rubric-based rewards。
复杂 Agent 任务通常包含多个执行步骤。
模型可能需要先搜索信息,再制定方案,然后调用工具完成任务。
罗福莉指出,团队采用智能体式的组内贡献归因,并结合测试用例和评分细则提供奖励。面对多种任务和多条执行轨迹,评判系统需提供有区分度的反馈,帮助模型从不同尝试中学习更有效的任务执行策略。
更细致的奖励分配机制,有助于模型学习更有效的执行路径。
从界面中的指标变化来看,MiMo-V2.6 的奖励相关指标正随训练推进而提升。
例如,从 critic/rewards/mean 曲线来看,Pro 的平均奖励由训练早期约 0.55 提高至 0.582,Flash 则由约 0.52 提高至 0.570,两条曲线均在波动中整体上升。
训练界面透露的信号:小米正押注 Agent 时代
除展示训练过程外,罗福莉公开的训练界面还揭示了 MiMo-V2.6 当前的能力变化。
截至发稿前,从该训练面板的数据来看,MiMo-V2.6-Pro 当前 DeepSWE v1.1 benchmark 得分达 63.72,MiMo-V2.6-Flash 得分达 60.77。
DeepSWE 主要用于测试模型的软件工程能力,包括代码理解、修改以及复杂开发任务处理。
与此同时,训练界面中的上下文长度指标也持续增长。 其中,ctx_total_length 数据显示,MiMo-V2.6-Pro 当前平均上下文长度已接近 10 万 Token,Flash 版本也超过此规模。
对 Agent 模型而言,长上下文能力意味着模型可持续记住之前的操作步骤、工具反馈以及任务状态,这也是完成复杂工作的基础。
值得注意的是,此次小米公开的是训练过程,而非最终模型成绩。
过去,大模型公司通常仅在模型发布时公布参数、榜单成绩和应用案例,训练过程往往处于黑盒状态。此次罗福莉分享实时训练界面,让外界能够看到模型训练中的计算规模、任务组成以及能力变化。
目前,Pro 和 Flash 的训练仍在继续。
随着曲线延伸,我们将能持续追踪三个关系:计算投入与能力提升的关系,执行长度与任务效果的关系,以及环境多样性与模型适应能力的关系。
罗福莉提出的「强化学习能扩展多远」,也将通过这些关系逐渐得到回答:增加的计算,能否让模型在更多环境中,更稳定、更高效地完成复杂任务。
本文来自微信公众号“APPSO”,作者:发现明日产品,36氪经授权发布。
亚博平台(yabo)官网-亚博系列全平台入口深耕采用银行级加密技术与多重身份验证机制,保障用户资金与数据安全。领域,用心服务每一位用户。
亚博平台的技术团队基于大数据与AI算法开发了智能路由系统,能够自动选择最优交易路径,将处理延迟降至毫秒级。同时,7×24小时客户支持团队提供中英文双语服务,响应时间不超过30秒,确保用户问题得到即时解决。
亚博平台(yabo)官网-亚博系列全平台入口以与多家持牌金融机构深度合作,资金流转全程受监管机构监控。为核心,带来高效便捷的体验。
05 条评论
亚博平台的全平台覆盖策略让用户可以在不同设备间无缝切换。无论是网页端、移动App还是微信小程序,体验始终一致。智能路由系统根据网络状况动态调整,确保交易处理成功率维持在99.9%以上。
王芳
2026年9月1日 上午10:45
亚博平台的客户支持体系是行业标杆。7×24小时中英文双语服务,响应时间不超过30秒,无论用户身处何地,都能获得及时、专业的帮助。这是我们对用户承诺的体现。
张伟
2026年9月8日 下午6:30
数字金融时代,合规与安全是平台的生命线。亚博科技控股有限公司严格遵循监管要求,采用多重身份验证与银行级加密技术,确保每一笔交易都受到严密保护。用户资金与数据安全始终是我们的首要任务。
李敏
2026年8月25日 下午3:12