Kaka Web3Kaka Web3
ProductContentCalendarDownload
中文
KAKA WEB3News

罗福莉:MiMo-V2.6的研发挑战已超过我参与过的DeepSeek R1

律动 BlockBeats·Sep 22, 2026 11:57 GMT+8
动察 Beating AI 快讯,小米 MiMo 负责人罗福莉在 MiMo-V2.6 发布后进一步解释了这轮强化学习。她称,自己曾参与 DeepSeek R1,而 MiMo-V2.6 背后的研究创新和工程挑战,在她看来已经超过 R1。 她还解释了 MiMo 为什么同时使用 MixRL 和 MOPD。MixRL 是把代码、通用 Agent、视觉和网络安全等可验证任务混在同一轮强化学习里一起训练;MOPD 则负责处理超长、难验证或奖励较主观的任务,先单独训练,再把这些能力整合回主模型。 游戏、3D 这类任务一次运行时间太长,而且不好自动判断对错。如果和代码等任务放在同一轮 RL 里,会明显拖慢训练。MiMo 因此把这类任务单独训练,再通过 MOPD 把学到的能力合回主模型。
Original source More content
Public content from Kaka Web3. Market and digital-asset information is not investment advice.