KAKA WEB3News
小米承认MiMo-V2.6会「原地复读」:RL把坏习惯越训越严重,9万美元修复
律动 BlockBeats·Sep 28, 2026 15:53 GMT+8
动察 Beating AI 快讯,小米 MiMo 团队复盘了 MiMo-V2.6 上线后的工具调用重复问题。模型有时会反复调用相同或高度相似的工具,持续消耗上下文,但任务没有进展。在 OpenCode 中,Flash 和 Pro 出现重复工具调用的回复占比一度分别达到 1.02% 和 0.54%。 问题出在强化学习的奖励设计。训练主要奖励「最后有没有把任务做对」,却没有充分惩罚过程中的低效行为。原来的规则只有单轮工具调用超过 32 次才会处罚,32 次以下的重复调用完全不扣分。随着 RL 规模扩大,这种坏习惯反而被不断强化。小米回放训练 checkpoint 后发现,Flash 中单轮调用超过 10 次的异常样本比例从 step 0 的 11.1% 增至 step 20 的 24.6%。 最直接的办法是把惩罚阈
动察 Beating AI 快讯,小米 MiMo 团队复盘了 MiMo-V2.6 上线后的工具调用重复问题。模型有时会反复调用相同或高度相似的工具,持续消耗上下文,但任务没有进展。在 OpenCode 中,Flash 和 Pro 出现重复工具调用的回复占比一度分别达到 1.02% 和 0.54%。 问题出在强化学习的奖励设计。训练主要奖励「最后有没有把任务做对」,却没有充分惩罚过程中的低效行为。原来的规则只有单轮工具调用超过 32 次才会处罚,32 次以下的重复调用完全不扣分。随着 RL 规模扩大,这种坏习惯反而被不断强化。小米回放训练 checkpoint 后发现,Flash 中单轮调用超过 10 次的异常样本比例从 step 0 的 11.1% 增至 step 20 的 24.6%。 最直接的办法是把惩罚阈值从 32 次降到 8 次,再重跑约 20 个 MixRL step,但预计要花 231 万美元。小米最终只训练了一个专门纠正重复调用的 RL teacher,跑 12 个 step、约 7000 个样本,再通过 MOPD 把这项能力合回 Pro 和 Flash。整轮修复约花 9 万美元,只有完整重训方案的约 4%,其他主要 benchmark 基本保持不变。 修复后的 MiMo-V2.6-Pro-MOPD 和 Flash-MOPD 权重已经开放,API 也已经切到新版,调用名称不变。小米还会重置 MiMo Desktop 用户当前周期的剩余额度。
Public content from Kaka Web3. Market and digital-asset information is not investment advice.