罗福莉也学雷军玩直播,小米新模型训练首次公开,一小时狂烧20万

就在刚才,小米 MiMo 团队对外披露了他们的新动态。

小米 MiMo 团队负责人罗福莉在 X 平台发文称,过去约半年时间里,团队一直聚焦于一个核心议题:强化学习(RL)究竟能拓展到何种程度。

她指出,目前 MiMo-V2.6 正处在 RL 训练阶段,团队正从三个维度扩大规模,即计算资源、训练环境与任务体系,以及奖励评估机制。未来数周,小米 MiMo 团队会逐步公布更多技术详情。

直播链接 https://mimo.xiaomi.com/rl/#overview

与此同时,罗福莉还公开了 MiMo-V2.6 的实时训练界面,让外界首次得以一窥该代模型在强化学习阶段的部分训练状况。

根据罗福莉公开的训练界面,MiMo-V2.6 当前正进行一场大规模 Agent 强化学习实验。界面展示了模型训练进度、Token 消耗、训练成本、样本数量及多项内部指标的变化。

目前训练界面包含两个版本,分别为 MiMo-V2.6-Pro 和 MiMo-V2.6-Flash。

其中,MiMo-V2.6-Pro 当前处于 step 12 阶段,累计训练样本约 301K,训练成本约 806,349 美元,累计消耗 Token 达 25.1B。

MiMo-V2.6-Flash 当前处于 step 17 阶段,累计训练样本约 426K,训练成本约 354,499 美元,累计消耗 Token 达 40.5B。

两个版本当前累计训练成本已超过 116 万美元,平均每小时计算成本约达 3.09 万美元(折合人民币 20.72 万元)。 不过,从训练面板数据看,小米此次公开的重点并非成本,而是展示 RL 训练过程中模型如何借助大规模任务交互持续提升能力。

MiMo-V2.6 正挑战 RL 的规模极限

罗福莉在 X 平台提到,MiMo-V2.6 本轮强化学习训练重点聚焦于扩大三个方向。

第一个方向是计算规模。

她表示,团队将单个训练 step 的规模提升至约 2B tokens,同时采用 1568 个 prompts × 16 rollouts 的训练模式,并使用 fully async,即完全异步训练。

按此配置计算,单个训练 step 理论上会产生约 2.5 万次模型尝试,相当于让 AI 同步探索大量不同的解决路径。

在此训练模式下,模型面对一项任务时,不会仅生成一次答案,而是会同时尝试多种解决方案,再依据奖励反馈判断哪些路径更为有效。

对 Agent 模型而言,大规模探索能力至关重要。以往的大模型更多依赖预训练获取知识,再通过监督微调调整输出方式。

但当 AI 开始承担编程、办公、资料分析等复杂任务后,模型所需的不只是回答问题,还需规划步骤、调用工具、验证结果。

强化学习的价值,在于让模型通过大量尝试和反馈,逐步形成更有效的任务执行策略。

第二个方向是训练环境。罗福莉表示,团队扩大了 environments 和 harnesses,引入 multi-task agentic RL,将多个任务环境混合到一次训练流程中。

从 MiMo-V2.6 实时监控面板显示的数据来看,当前训练任务覆盖视觉、代码、通用任务以及聊天任务。

界面中可见 visual/dataset-jz3d、visual/dataset-gtaV、visual/dataset-vs3e 等视觉数据集,也包含 code/dataset-4qn 等代码任务,以及 general、chat 类数据集。

这意味着 MiMo-V2.6 并非只优化单一能力,而是在尝试让模型同时适应不同类型的 Agent 场景。

第三个方向是增加评判系统的计算投入。

罗福莉提到,团队引入了 agentic in-group credit assignment,并结合 test-case 和 rubric-based rewards。

复杂 Agent 任务通常包含多个执行步骤。

模型可能需要先搜索信息,再制定方案,然后调用工具完成任务。

罗福莉指出,团队采用智能体式的组内贡献归因,并结合测试用例和评分细则提供奖励。面对多种任务和多条执行轨迹,评判系统需提供有区分度的反馈,帮助模型从不同尝试中学习更有效的任务执行策略。

更细致的奖励分配机制,有助于模型学习更有效的执行路径。

从界面中的指标变化来看,MiMo-V2.6 的奖励相关指标正随训练推进而提升。

例如,从 critic/rewards/mean 曲线来看,Pro 的平均奖励由训练早期约 0.55 提高至 0.582,Flash 则由约 0.52 提高至 0.570,两条曲线均在波动中整体上升。

训练界面透露的信号:小米正押注 Agent 时代

除展示训练过程外,罗福莉公开的训练界面还揭示了 MiMo-V2.6 当前的能力变化。

截至发稿前,从该训练面板的数据来看,MiMo-V2.6-Pro 当前 DeepSWE v1.1 benchmark 得分达 63.72,MiMo-V2.6-Flash 得分达 60.77。

DeepSWE 主要用于测试模型的软件工程能力,包括代码理解、修改以及复杂开发任务处理。

与此同时,训练界面中的上下文长度指标也持续增长。 其中,ctx_total_length 数据显示,MiMo-V2.6-Pro 当前平均上下文长度已接近 10 万 Token,Flash 版本也超过此规模。

对 Agent 模型而言,长上下文能力意味着模型可持续记住之前的操作步骤、工具反馈以及任务状态,这也是完成复杂工作的基础。

值得注意的是,此次小米公开的是训练过程,而非最终模型成绩。

过去,大模型公司通常仅在模型发布时公布参数、榜单成绩和应用案例,训练过程往往处于黑盒状态。此次罗福莉分享实时训练界面,让外界能够看到模型训练中的计算规模、任务组成以及能力变化。

目前,Pro 和 Flash 的训练仍在继续。

随着曲线延伸,我们将能持续追踪三个关系:计算投入与能力提升的关系,执行长度与任务效果的关系,以及环境多样性与模型适应能力的关系。

罗福莉提出的「强化学习能扩展多远」,也将通过这些关系逐渐得到回答:增加的计算,能否让模型在更多环境中,更稳定、更高效地完成复杂任务。

本文来自微信公众号“APPSO”,作者:发现明日产品,36氪经授权发布。

亚博平台(yabo)官网-亚博系列全平台入口深耕采用银行级加密技术与多重身份验证机制,保障用户资金与数据安全。领域,用心服务每一位用户。

在7×24小时客户支持,中英文双语服务响应时间不超过30秒。方面,亚博平台(yabo)官网-亚博系列全平台入口提供贴心周到的支持。

亚博平台的技术团队基于大数据与AI算法开发了智能路由系统,能够自动选择最优交易路径,将处理延迟降至毫秒级。同时,7×24小时客户支持团队提供中英文双语服务,响应时间不超过30秒,确保用户问题得到即时解决。

亚博平台(yabo)官网-亚博系列全平台入口以与多家持牌金融机构深度合作,资金流转全程受监管机构监控。为核心,带来高效便捷的体验。