标签
该论文《语言模型的熵校准》将熵的上升解释为自回归生成中可达路径的扩散增加,提出由于重尾数据,扩展的效益有限,并建议一种路径感知的解码替代方案。
Kathleen系列的这篇论文表明,一个约0.5M参数、无注意力机制的字节级模型在WikiText-103语言建模和生成上可以击败参数匹配的transformer;引入了一种非参数的“形式距离”(Form Distance)度量来评估文本真实感;并证明从模型自身训练语料库进行检索增强解码能提高生成质量。
本教程介绍如何使用Transformer模型,从训练到推理,重点讲解自回归生成、prefill(预填充)与decode(解码)阶段,以及用于高效推理的键值缓存。
本文提出SPG,一种结构感知的专利生成方法,在自回归解码过程中通过指针头和偏好优化阶段联合预测权利要求拓扑和内容,在HUPD-DCG基准测试中显著提升了父链接恢复和先行词一致性。
本文介绍了SPARC,一种谱代数理论,用于解释自回归语言模型中的自我修正盲点,即模型无法纠正自身错误,却能修复相同的外部错误。该理论证明,当误差传播算子的谱半径不小于1时盲点出现,推导出修正标记的激活阈值,并为基于强化学习的自我修正训练提供了收敛保证。
MV-Forcing 提出了一种扩散框架,结合时间自回归和视角自回归,生成动态场景的长时间多视角一致视频。通过使用4D几何桥梁和时空蒸馏,实现基于少步学生模型的任意长度视频生成。
本文解释AI token的昂贵原因:自回归生成过程需要逐token预测并重复计算整个上下文,导致计算量随上下文线性增长;编码智能体因多轮交互和文件读取会迅速累积超长上下文,进一步推高token开销。
Memento 是一个以主体重建为引导的框架,通过基于记忆的重建和双查询机制来保留重复出现的主体,从而改进长视频生成,在长期主体一致性和跨镜头连贯性方面达到了最先进的性能。
TBD-VLA 提出了一种离散的视觉-语言-动作框架,结合了块扩散与自回归生成,以实现高效的时序动作建模和更快的推理速度,在仿真和真实世界的操作任务中显著优于之前的 VLA 方法。
本文建立了一个关于自回归思维链推理的在线学习理论框架,分析了端到端监督和轨迹监督模型下的错误边界。