
Universal Test-Time Training
把测试时训练的快权重在整个网络深度上共享,而不是每层各存一份私有状态;模型因此成为一个跨(块,层)的单一递归,并在相同状态规模下提升长上下文检索能力。
Universal Test-Time Training 架构图:展开的 uTTT 块,以及跨块共享的快权重专家池(uTTT-MoE)或共享稠密快权重算子(uTTT-Dense)。
主页 / 论文
加粗为本人;* 表示共同第一作者。点击图片可放大。 把测试时训练的快权重在整个网络深度上共享,而不是每层各存一份私有状态;模型因此成为一个跨(块,层)的单一递归,并在相同状态规模下提升长上下文检索能力。 Universal Test-Time Training 架构图:展开的 uTTT 块,以及跨块共享的快权重专家池(uTTT-MoE)或共享稠密快权重算子(uTTT-Dense)。
Universal Test-Time Training

