KAKA WEB3快讯
代季峰NaiveAI首模开源:AI参与6天跑151轮优化
律动 BlockBeats·2026-09-28 11:40 GMT+8
动察 Beating AI 快讯,清华大学副教授代季峰创办的 NaiveAI 发布 Naive-N0.5-Flash,并开放模型权重。模型基于小米 MiMo-V2.5 Base 改造,使用 MIT 协议开源。 NaiveAI 保留了原有的 MoE 架构,重点改了注意力机制。团队把全局注意力换成滑动窗口注意力和 DeepSeek 稀疏注意力,再继续训练 3.25 万亿 tokens。改造后的模型原生支持 100 万 token 上下文,可以减少处理超长文本时的计算量。 AI 也直接参与了研发。它负责写代码、跑实验、分析结果和继续优化,研究员负责定方向和做关键决定。以推理系统 NaiveRT 为例,团队 6 天跑了 151 轮优化实验,其中 63 轮被采用。 官方公布的最高推理速度为 2122 tok/s,但测试条
动察 Beating AI 快讯,清华大学副教授代季峰创办的 NaiveAI 发布 Naive-N0.5-Flash,并开放模型权重。模型基于小米 MiMo-V2.5 Base 改造,使用 MIT 协议开源。 NaiveAI 保留了原有的 MoE 架构,重点改了注意力机制。团队把全局注意力换成滑动窗口注意力和 DeepSeek 稀疏注意力,再继续训练 3.25 万亿 tokens。改造后的模型原生支持 100 万 token 上下文,可以减少处理超长文本时的计算量。 AI 也直接参与了研发。它负责写代码、跑实验、分析结果和继续优化,研究员负责定方向和做关键决定。以推理系统 NaiveRT 为例,团队 6 天跑了 151 轮优化实验,其中 63 轮被采用。 官方公布的最高推理速度为 2122 tok/s,但测试条件比较特殊:使用 8 张 GPU,关闭思考模式,不计算输入处理时间,而且取的是 41 次请求中表现最好的一秒。标准模式下,官方给出的速度约为每位用户 50 tok/s。
来自 Kaka Web3 的公开内容。市场与数字资产信息不构成投资建议。