标签
RoboTTT将视觉运动上下文扩展到机器人策略的8K时间步长,实现了从人类视频演示中一次模仿、即时策略改进以及对扰动的鲁棒性。它比基线提高了87%,并完成了一个五分钟、十阶段的组装任务,而基线无法完成。
李飞飞强调了一种新的用于机器人学习的测试时训练方法,该方法由Stanford SVL和NVIDIA Robotics合作开发,可将机器人模型上下文扩展到8000个时间步长,且推理成本恒定。
提出了自引导测试时训练(S-TTT)方法,模型在长上下文中识别相关证据片段进行自适应,在长上下文推理基准上实现了高达15%的相对改进。
本文介绍了一种用于3M参数Transformer的训练好的快速权重记忆机制,该机制在推理时通过仅前向传播的测试时训练安装从未训练过的规则,且不产生任何迁移。该工作可在单块RTX 3090上完全复现。
本文介绍了一种行为评估框架,用于校准关于LLM测试时训练中部署时记忆的声明,提出了证据阶梯和显式基线,以弥合代理指标与行为证据之间的差距。
本文介绍了U-TTT,一种带有测试时训练层和双域适配的U型深度学习模型,用于在分布偏移下实现鲁棒的PET图像去噪,在不同剂量水平和扫描仪类型上均达到了最先进性能。
提出 EASE-TTT,一种测试时训练框架,将自适应与检索到的证据对齐,以提高较小语言模型在长上下文问答中的性能。
Alpha-RTL (TTT-RTL) 引入了一种用于 RTL 硬件优化的测试时训练框架,利用带有 EDA 反馈的强化学习来优化 LLM 生成的设计。它在基准测试上实现了显著的 PPA 减少。
本文提出了一种方法,将预训练的Softmax注意力模型转换为线性复杂度的测试时训练(TTT)架构,在显著加速推理的同时,实现了与微调Softmax模型相当的文生图质量。该方法通过对Stable Diffusion 3.5进行线性化得到SD3.5-T^5,在1K分辨率下实现1.32倍加速。
本文识别了测试时训练(TTT)的三种威胁模型,攻击者可利用这些模型绕过LLM的安全过滤器,实现高攻击成功率。研究结果表明,TTT引入了新的漏洞,破坏了现有的安全护栏。
TEMPO 提出一种测试时训练框架,在策略微调与评判器再校准之间交替,防止多样性崩塌并持续放大推理模型的性能,将 Qwen3-14B 在 AIME 2024 上的得分从 42.3% 提升至 65.8%。