Kaka Web3Kaka Web3
产品内容日历下载
EN
KAKA WEB3快讯

大模型开始自己「打草稿」:NCP把猜后文塞进模型内部

律动 BlockBeats·2026-09-14 20:17 GMT+8
动察 Beating AI 快讯,上海 AI Lab 和上海交大发布 89 亿参数模型 NCP-ArchPreview。普通大模型主要训练「猜下一个 token」,NCP 还会预测后面一小段对应的内部概念信号,再用它辅助 token 生成。最终仍然逐 token 输出,但模型内部已经会提前猜后文。 这套信号还能拿来给投机解码提速。DFlash、DSpark 这类方案会让一个小模型先猜后文,再交给大模型统一检查。NCP 团队把内部概念信号也交给这个小模型,相当于先给它一点「后面大概怎么写」的提示,再让它一次并行猜 16 个 token。 这样一来,小模型猜中的内容更多。四项测试里,大模型每验证一次,平均能通过的 token 从 5.933 个升到 6.180 个,提升 4.17%;HumanEval 上提升 7.
动察 Beating AI 快讯,上海 AI Lab 和上海交大发布 89 亿参数模型 NCP-ArchPreview。普通大模型主要训练「猜下一个 token」,NCP 还会预测后面一小段对应的内部概念信号,再用它辅助 token 生成。最终仍然逐 token 输出,但模型内部已经会提前猜后文。 这套信号还能拿来给投机解码提速。DFlash、DSpark 这类方案会让一个小模型先猜后文,再交给大模型统一检查。NCP 团队把内部概念信号也交给这个小模型,相当于先给它一点「后面大概怎么写」的提示,再让它一次并行猜 16 个 token。 这样一来,小模型猜中的内容更多。四项测试里,大模型每验证一次,平均能通过的 token 从 5.933 个升到 6.180 个,提升 4.17%;HumanEval 上提升 7.59%。接入这套信号只给草稿模型增加约 4 万参数。 同样是 89 亿参数,NCP 用普通 Transformer 约 85% 的训练计算量,就能把训练误差降到差不多的水平。
查看原始来源 更多内容
来自 Kaka Web3 的公开内容。市场与数字资产信息不构成投资建议。