一、 沉寂半年后重回大众视野

在人工智能领域备受关注的小米迎来新动态。沉寂半年的小米 MiMo 大模型团队负责人、前 DeepSeek 研究员罗福莉,于9月17日凌晨在 X 平台发文,正式对外公开并直播了当前大模型的训练过程。此次动作标志着她再次卷入激烈的大模型技术竞争中,同时也让外界得以首次窥探小米最新一代模型的内部训练状态。

二、 MiMo-V2.6的 RL 实验与三大扩展方向

根据罗福莉分享的实时训练页面显示,目前小米旗下的最新大模型MiMo-V2.6正在进行大规模的 Agent(智能体)强化学习(RL)实验。团队在此次运行中重点推进了三个维度的技术扩展:

计算资源扩展:每步计算资源大约消耗20亿 token,包含1568个提示乘以16次 rollout,采取完全异步的运行模式。

环境和测试框架扩展:构建了多任务代理式 RL,在单次运行中同步混合多个测试框架。

评估计算扩展:引入代理式组内信用分配,配备了实际测试用例和基于量规的奖励机制。

罗福莉同时透露,团队将在未来的几周内逐步向外界开源相关的技术细节。

三、 高昂的训练成本与双版本表现

从公开的实时训练数据来看,此次大模型训练展现出极高的资金与算力消耗。训练页面中目前主要包含两个并行版本:

MiMo-V2.6-Pro:累计训练时长达到1天19小时,累计耗资约89万美元,平均每小时的训练成本超过2万美元。

MiMo-V2.6-Flash:累计训练时长为1天14小时,累计耗资约39.7万美元,平均每小时的训练成本超过1万美元。

两个版本的累计训练成本目前已经突破128万美元,折算下来整体每小时的耗费超过3万美元,充分凸显出当前头部大模型在强化学习阶段对海量算力的极致诉求。

四、 团队背景与此前进展

在业务布局方面,小米高层此前曾多次公开披露 AI 领域的阶段性成果。今年3月份,小米创始人雷军曾在微博发文透露,万亿参数大模型MiMo-V2-Pro曾跻身全球大模型综合智能排行榜 Artificial Analysis 的全球第八位,在品牌排名中位列全球第五,整体表现超越了 xAI 的 Grok 模型,并计划在后续保持快速迭代与增强。

作为核心领军人物,罗福莉是一位备受瞩目的“95后”AI青年科学家。公开资料表明,她本科毕业于北京师范大学计算机专业,随后在北京大学攻读计算语言学硕士学位。毕业后,她曾加入阿里巴巴达摩院机器智能实验室担任研究员,负责多语言预训练模型 VECO 的开发,并推动了 AliceMind 项目的开源。

2022年,罗福莉加入 DeepSeek 母公司幻方量化从事深度学习相关工作,此后担任 DeepSeek 深度学习研究员,参与了 DeepSeek-V2等核心模型的研发工作。直到去年11月12日,罗福莉在朋友圈发文确认加入小米,投身 Xiaomi MiMo 团队,并致力于构建从语言迈向物理世界的 AGI(通用人工智能)未来。