标签
本文介绍了FormatMix,一种多格式训练方法,通过将部分训练项扩展为多个等效格式来提升LLM在不同答案格式间的一致性,表明格式多样性是鲁棒性的关键。
Rich Sutton argues that generative AI trained by supervised learning cannot achieve genuine novelty and quality simultaneously, and that true discovery requires a 'vary, evaluate, select' mechanism found in reinforcement learning rather than pure imitation.
本文形式化了监督学习中贝叶斯充分表示(Bayes-sufficient representations)的概念,定义了在给定损失函数下,一个表示何时恰好保留了贝叶斯最优预测所需的信息。文章引入了贝叶斯商(Bayes quotient)作为依赖于损失函数的典范对象,并将该框架与性质激发(property elicitation)相关联,通过实验阐明了充分性、最小性与冗余保留信息之间的区别。
本文提出了 Q-align DT 框架,该框架将 return-to-go 与 Q 值对齐,以提高离线强化学习中的可控性和性能,在 D4RL 基准上取得了优异的结果。
本文对基础模型在时间序列预测中的应用进行了评估,与四种操作领域中的监督学习方法进行了比较,并提出了一种复杂性路由器,用于选择性地将序列分配给最优模型类别,以平衡准确性和推理成本。
本文提出了目标条件监督学习(GCSL)作为LLM的离线微调框架,该方法将反馈作为显式目标,通过一种新颖的目标公式和自然语言目标表示,使用监督学习训练模型。在无毒生成、代码生成和LLM推荐三个任务上的评估显示,该方法优于标准的离线基线方法。
本文研究浅层神经网络代理是否能够通过强化学习掌握纸牌游戏Schnapsen,超越监督模仿基线,并在一项与基于强搜索的对手的对比中取得有竞争力的结果。
本文认为,探索对于所有学习系统(包括监督学习)都是至关重要的,并提出了一种通用探索框架,以推动开放式学习走向通用智能。
本文提出了一个统一的几何框架,证明加权InfoNCE目标可以解释为距离几何问题,从而精确刻画了有监督和弱监督对比学习方法的最优嵌入,并揭示了这些嵌入何时在几何上可实现、退化或不一致。
本文提出了 UniSD,这是一种用于适应大型语言模型的统一自蒸馏框架,整合了监督可靠性、表征对齐和训练稳定性的机制。实验结果表明,UniSD 在多个基准测试中均优于基础模型和现有基线方法。