标签
本文介绍了ActionPiece,一种用于自回归视觉-语言-动作模型的新型动作分词方法,该方法利用物理秩一致性来提高动作关系的保真度,并在LIBERO和SimplerEnv等基准测试中进行了评估。
SAPO 是一种用于智能体强化学习的低内存、高计算效率框架,它在单个自回归骨干中共享策略和价值函数,在 ALFWorld 和 WebShop 的实验中表现优于 PPO 和 GRPO。
本文提出HB-SJD,一种用于视觉策略内蒸馏的批处理推测性雅可比解码方法。该方法通过并行处理多个词元来加速展开生成,在保持生成质量的同时缩短训练时间。
本文研究了表格基础模型(TFMs)如 TabPFN、TabICL、TabDPT 和 TabFM 是否能够产生与任何联合分布一致的预测。结果表明,所有被评估的 TFM 在分类和回归任务中均违反了边际化一致性和分解一致性,从而对其贝叶斯推断的主张提出了质疑。
本文介绍了一种无训练的方法,通过利用3D引擎提供的时空对应,在相机重访位置时保持外观一致性,从而改进自回归生成渲染中的重访一致性。
介绍了一种代理潜在策略优化(SLPO)方法,将结果奖励强化学习应用于自回归潜在推理器,实现测试时扩展和变长策略,从而在更难实例上提高准确率。
本文将从认知科学中提出的QQ等式发展为针对大型语言模型(LLM)的审计标准,刻画了理论上的机制类别,并在一个开源权重的指令微调模型上进行了实证测试,结果发现饱和(近确定性响应)阻碍了分布级审计。
介绍了 Member vs Generated Inference (MGI) 任务,用于区分生成模型中的训练成员与生成输出,并提出了 Data Circuit Breaker (DCB),一种结合自编码器和潜在生成器信号的三阶段方法,在自回归和扩散模型中均优于现有方法。
在单个H100(FP8)上对本地开源权重LLM进行的基准测试比较显示,DiffusionGemma速度提升4倍,但错误数量比Gemma4 26B A4B多6倍,突显了扩散模型与自回归模型在速度和准确性之间的权衡。
本文介绍了OPDLM,一种通过在线策略蒸馏将自回归语言模型转换为扩散语言模型的方法,所需训练令牌数量减少15倍到7000倍,同时保留原始模型的知识。
研究人员提出了一种用于图生成的轻量级自回归框架,该框架使用结构引导的拓扑排序实现了接近对数线性的复杂度,解决了现有扩散和自回归方法在可扩展性和新颖性方面的局限性。该方法同时支持LSTM和Mamba风格的主干网络,在分子和非分子基准测试中展示了改进的新颖性,同时保持了有效性和独特性。
本文分析了大型语言模型安全对齐为何脆弱,将其归因于“自回归一致性”——即下一个词元预测倾向于扩展当前响应轨迹——这导致对齐更新集中在早期词元上。作者提出了一种利用这一特性的“随机插入攻击”,并设计了一个对抗性安全对齐框架来应对。
本文提出了一种历史引导的自回归流匹配方法,用于从沸腾动力学部分观测中重构完整的时空场(速度和温度),解决了非马尔可夫后验下的不适定逆问题。
LongLive-RAG将长视频生成形式化为检索增强生成问题,利用先前生成潜变量的动态记忆来减少误差积累和身份漂移,在多种自回归骨干网络上提升了生成质量。
介绍TUBE,一种用于离散扩散语言模型的对数似然变分上界,实现更好的评估,并揭示掩码扩散模型仍不如自回归模型。
本文介绍了归因合同(Attribution Contract),这是生成式语言模型中特征归因声明的一种规范,解决了特征定义不清以及归因方法评估方式模糊的问题。论文以自回归模型和扩散模型为例,展示了归因何时具有信息量,何时可能产生误导。
KV cache 在自回归生成过程中存储先前计算的键向量和值向量,使模型能够避免在每一步重新计算整个序列,从而显著加速推理,但代价是内存使用增加。
Q-ARVD是一种新颖的量化框架,通过解决帧级量化敏感度失衡和权重异常值模式,降低自回归视频扩散模型的推理成本。
dLLM是一个开源库,可将任何自回归大语言模型转换为扩散大语言模型,实现并行解码和更快的文本生成。
dLLM是一个开源Python库,能以极少的计算资源将任意自回归语言模型转换为扩散语言模型,统一训练和评估。