Kaka Web3Kaka Web3
产品内容日历下载
EN
KAKA WEB3快讯

小米先公开MiMo-V3新架构:百万Token预填充计算量降80%

律动 BlockBeats·2026-09-24 11:38 GMT+8
动察 Beating AI 快讯,小米 MiMo 团队公开下一代 MiMo-V3 将采用的 HySparse2 架构。它主要解决 Agent 越跑越贵的问题。Agent 每次只发出很短的指令,却可能从网页、终端和工具拿回大段内容。模型必须先把这些新内容读完;上下文越长,这一步越耗算力,KV Cache 也越占显存。 HySparse2 先把模型分成前后两段。前半段负责处理输入,后半段继续推理和生成。后半段需要的上下文信息,可以直接从前半段已经算好的结果生成,因此 prefill 不用再把后半段完整跑一遍。这个思路来自微软研究院 2024 年提出的 YOCO,名字就是「You Only Cache Once」,核心是让后半段共享前面算好的信息,少存缓存,也少做重复计算。 它同时重做了稀疏注意力。普通全注意力每次都
动察 Beating AI 快讯,小米 MiMo 团队公开下一代 MiMo-V3 将采用的 HySparse2 架构。它主要解决 Agent 越跑越贵的问题。Agent 每次只发出很短的指令,却可能从网页、终端和工具拿回大段内容。模型必须先把这些新内容读完;上下文越长,这一步越耗算力,KV Cache 也越占显存。 HySparse2 先把模型分成前后两段。前半段负责处理输入,后半段继续推理和生成。后半段需要的上下文信息,可以直接从前半段已经算好的结果生成,因此 prefill 不用再把后半段完整跑一遍。这个思路来自微软研究院 2024 年提出的 YOCO,名字就是「You Only Cache Once」,核心是让后半段共享前面算好的信息,少存缓存,也少做重复计算。 它同时重做了稀疏注意力。普通全注意力每次都要看完整上下文,HySparse2 只让少数层这么做。它们先从长上下文里挑出最相关的 1024 个 token,后面的层直接沿用这批结果,同时固定保留最近 128 个 token。上一代 HySparse 是每 64 个 token 打成一组再挑,只要一组里有重要信息,整组都要留下。现在改成逐个 token 挑,同样的计算量可以留给更多真正相关的内容。单独测试这一改动后,两项长文本检索成绩分别提高 6.57 分和 8.14 分。 论文用一款总参数 800 亿、每次激活约 30 亿参数的模型做对照。49 层模型在 prefill 阶段只需要跑前 25 层。输入达到 100 万 token 时,相比 MiMo-V2 系列采用的混合滑动窗口注意力,prefill 计算量降到约 1/5,KV Cache 从 12.09GB 降到 2.69GB。
查看原始来源 更多内容
来自 Kaka Web3 的公开内容。市场与数字资产信息不构成投资建议。