标签
本文介绍了一种受子黎曼启发的SRM-LoRA方法,该方法利用基于敏感度的黎曼度量来降低低秩自适应过程中的LLM幻觉。该度量重新塑造了反向传播梯度,抑制了高成本的更新方向,从而在HaluEval-QA等基准测试上提高了事实可靠性。
Sergey Levine 宣布将在 ICML 2026 离线数据集决策研讨会发表演讲,内容涵盖从基于模型的优化到离线强化学习的数据驱动决策基础。
本文表明,在聊天模型中,拒绝行为由晚期层的合规模型人格方向门控,而非孤立的机制。操控人格可抑制拒绝,而重新引入拒绝仅在晚期层部分恢复拒绝,揭示了人格与安全表示之间的耦合。
UNIQ引入了一种用于离线强化学习的共形校准方法,该方法基于不确定性对每个状态自适应调整保守性,在部分D4RL基准测试上优于IQL,同时保持内存效率。