Kaka Web3Kaka Web3
产品内容日历下载
EN
KAKA WEB3快讯

循环Transformer新架构:RLT让Token之间「接着算」

律动 BlockBeats·2026-09-14 16:33 GMT+8
动察 Beating AI 快讯,普林斯顿博士生 Yifan Zhang 提出 Recurrent Looped Transformer(RLT),给 Transformer 加了一条会一直往后传的内部状态。 普通 Transformer 生成下一个 Token 时,主要通过 Attention 和 KV 缓存读取前文。RLT 除了看前文,还会把上一个 Token 算完留下的内部状态,直接交给下一个 Token 继续用。 可以把它理解成给模型加了一根「思维接力棒」。第一个 Token 算完,把当前状态传给第二个;第二个更新后再传给第三个。每个 Token 自己跑的网络层数没有变,但这根状态链会随着文本越来越长。论文把它称为「无限时间深度」,指的就是这条计算链没有固定长度上限。 它和最近讨论较多的 Ouro、As
动察 Beating AI 快讯,普林斯顿博士生 Yifan Zhang 提出 Recurrent Looped Transformer(RLT),给 Transformer 加了一条会一直往后传的内部状态。 普通 Transformer 生成下一个 Token 时,主要通过 Attention 和 KV 缓存读取前文。RLT 除了看前文,还会把上一个 Token 算完留下的内部状态,直接交给下一个 Token 继续用。 可以把它理解成给模型加了一根「思维接力棒」。第一个 Token 算完,把当前状态传给第二个;第二个更新后再传给第三个。每个 Token 自己跑的网络层数没有变,但这根状态链会随着文本越来越长。论文把它称为「无限时间深度」,指的就是这条计算链没有固定长度上限。 它和最近讨论较多的 Ouro、Astra 类循环架构也不太一样。那类方法主要让同一个 Token 在同一套网络里多跑几轮;RLT 则让不同 Token 之间持续传递内部状态。前者像一道题交卷前多检查几遍,后者更像上一棒跑完,把手里的进度直接交给下一棒。
查看原始来源 更多内容
来自 Kaka Web3 的公开内容。市场与数字资产信息不构成投资建议。