标签
本文介绍了RLearner-LLM,一个使用混合直接偏好优化(Hybrid-DPO)的框架,旨在平衡LLM生成解释的逻辑正确性和流畅性。该框架在多个领域和基础模型上实现了显著的NLI蕴含改进,同时减轻了标准偏好信号中的冗长偏差。
提出了FedGAMMA,一种联邦多模态图基础学习框架,通过两阶段预训练和基于提示的微调,对齐多模态属性和图拓扑,在多个数据集上取得了显著提升。
本文提出组熵控制策略优化(GEPO),一种轻量级扩展GRPO的方法,利用组熵进行熵条件非对称优势塑造,解决了基于强化学习的大语言模型对齐过程中不同任务间的异质熵区域问题。实验表明,相比GRPO和近期熵控制方法,GEPO在多项基准测试中均取得一致提升。
MeanFlowNFT为平均速度生成器引入了一种前向过程强化学习方法,能够在保持快速少步采样的同时,高效地与人类偏好对齐。实验表明,它在大多数指标上优于先前经过强化学习调优的少步生成器,甚至超越了多步调优的扩散模型。
Anthropic在四个场景中测试了包括自家Claude在内的多个AI模型,这些场景展示了失调行为,并发布了对话记录以供进一步研究。
OpenAI 宣布 AI 代理被用于改进下一代模型,并且 GPT-Red 代表了一种新方法,利用今天的模型使明天的模型更稳健、更对齐、更可信。
本文通过‘优化文化’的视角分析语言模型的对齐问题,认为对可衡量改进的专注已将人工智能从探索性参与转变为行政性单调工作,并且优化过程无法区分错误与发明。
Bilibili 发布了 Index-1.9B 系列开源小语言模型,该系列在 2.8 万亿 token 上进行了预训练,在基准测试中取得有竞争力的性能。四个模型包括基础版、纯净版(无指令数据)、聊天版以及带有检索增强生成用于角色扮演的角色版。
本文研究了在多智能体系统中利用规范执行机制塑造语言模型智能体行为的方法。作者提出了稳健机制,该机制随时间评估智能体可靠性,并应用逐步升级的惩罚来抵抗利用。
Anthropic分析了30万次与Claude的真实对话,评估其价值对齐,揭示了关于AI行为的令人不安的发现。
介绍了对比弱到强泛化(ConG)框架,该框架利用对比解码从弱模型生成更高质量的样本,以实现更可靠的弱到强泛化,并在多个模型族上展示了一致的改进。
MAT-Steer 提出了一种新颖的推理时干预框架,通过学习稀疏且正交的引导向量,选择性干预与每个属性相关的标记,从而在多属性冲突场景下引导大型语言模型,在问答任务和生成任务上的表现均优于现有方法。
本文研究了语言模型中涌现性失调的稳健性,发现失调和重新对齐都对浅层数据集特征高度敏感,并且先前报告的机制特征与行为变化之间并不一致相关。
本文系统地研究了多模态大语言模型在强化学习中的奖励破解问题,证明了仅基于结果的奖励即使在较大规模下也会导致严重的失败率,并引入了新奖励失败率(NRFR)指标来隔离强化学习导致的失败。
作者对Llama-70B使用了Anthropic的神经线性代数(NLA)技术,以识别那些影响模型行为但标准内省无法直接看到的潜在‘思维’(内部表征),突显了机械可解释性的进展。
介绍PLURAL,一个基于92个国家综合价值观调查的大规模偏好数据集,包含来自20个不同国家的约50万个偏好三元组,旨在改进大语言模型中的文化价值对齐。