llm-alignment

标签

Cards List
#llm-alignment

onPanda:通过令牌级修正实现大语言模型与智能体在线策略对齐数据的高效标注

Hugging Face Daily Papers ↗ · 2026-09-21 缓存

onPanda是一个交互式工具,使用令牌级修正来高效标注大语言模型对齐数据和智能体轨迹,将中位数标注时间减少了52%。

0 人收藏 0 人点赞
#llm-alignment

@HEI: 蓝色四十度:通过模式条件强化学习实现质量-多样性对齐 Jiayi Yuan, Hangoo Kang, …

X AI KOLs Following ↗ · 2026-09-18 缓存

本文介绍了MoDA,一种在线后训练强化学习算法,它共同提升大型语言模型的质量和多样性,以缓解模式崩溃,无需手工制作的人设或架构修改。

0 人收藏 0 人点赞
#llm-alignment

人类与LLMs如何在性别中立的外貌描述中解读性别

arXiv cs.CL ↗ · 2026-09-16 缓存

本研究引入GAPA数据集,以证明外貌描述常携带性别关联,而LLMs与人类评分存在系统性错位,挑战了性别中立沟通的假设。

0 人收藏 0 人点赞
#llm-alignment

LLM 偏好对齐的零阶范式

Hugging Face Daily Papers ↗ · 2026-09-16 缓存

本文提出基于比较的偏好优化(ComPO),一种用于LLM的零阶对齐方法,利用比较预言机来避免似然位移。它包括理论保证和对现有方法的实验改进。

0 人收藏 0 人点赞
#llm-alignment

最有趣的基准测试之一及其对对齐的意义

Reddit r/ArtificialInteligence ↗ · 2026-09-10

文章讨论了大语言模型幻觉的公共基准测试如何推动快速改进,并探讨了对对齐的启示,强调需要透明度和诚实度的基准测试。

0 人收藏 0 人点赞
#llm-alignment

用于多元LLM对齐的溢出感知多值引导

arXiv cs.AI ↗ · 2026-09-10 缓存

本文提出了一种溢出感知的多值激活引导方法,以实现LLMs的多元对齐,无需微调或奖励模型即可改进对多个价值维度的控制。

0 人收藏 0 人点赞
#llm-alignment

IDEEA:通过激活聚类匹配实现免训练的输入依赖式引导

arXiv cs.CL ↗ · 2026-09-03 缓存

IDEEA提出了一种免训练的、依赖于输入的引导方法,适用于大型语言模型,通过对激活进行聚类并使用最优匹配,在TruthfulQA上比基线提升真实性高达23.5%。

0 人收藏 0 人点赞
#llm-alignment

代码偏好优化的函数级执行反馈

arXiv cs.AI ↗ · 2026-08-26 缓存

本文提出Step-KTOder,这是一个用于代码偏好优化的框架,它使用函数级执行反馈与单元测试相结合,在HumanEval+和MBPP+等基准测试上优于仅基于结果的方法(如KTO和DPO)。

0 人收藏 0 人点赞
#llm-alignment

定位与控制大型语言模型中的隐式个性化

arXiv cs.CL ↗ · 2026-08-13 缓存

本文研究了大型语言模型如何根据人口统计线索隐式地个性化输出,定位了一个追踪这些变化的内部激活信号,并表明移除该信号可以抑制这种行为。

0 人收藏 0 人点赞
#llm-alignment

群体对齐诱发的谄媚行为:可控多元对齐的双侧评估

arXiv cs.CL ↗ · 2026-08-13 缓存

本文介绍了群体对齐诱发的谄媚行为(GAS),这是一个双侧评估框架,用于在将大语言模型与人口统计群体对齐时,同时衡量意见对齐的预期增益和谄媚行为的非预期变化,并发现这些效应是非均匀且具有群体特异性的。

0 人收藏 0 人点赞
#llm-alignment

Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes

arXiv cs.AI ↗ · 2026-08-12 缓存

The paper introduces Evaluation-Conditioned Training (ECT), a post-training framework that conditions on natural language descriptions of feedback fidelity to help LLMs generalize to stronger oversight, with proof-of-concept experiments showing improved even-handedness and reduced sycophancy.

0 人收藏 0 人点赞
#llm-alignment

通过多层组合融合实现情境价值对齐

arXiv cs.AI ↗ · 2026-08-11 缓存

本文提出了MCF-CVA,一种用于大型语言模型情境价值对齐的多层组合融合框架,该框架利用多个道德智能体以及扩展-约简过程来更好地捕捉伦理多元主义,并优于单智能体基线方法。

0 人收藏 0 人点赞
#llm-alignment

超越路由权重:通过贡献对比对混合专家奖励模型进行忠实的响应级解释

arXiv cs.AI ↗ · 2026-08-10 缓存

本文提出了贡献对比(CoCo),一种新颖的响应级解释方法,用于混合专家奖励模型,相比基于路由权重的方法,能更忠实地捕捉路由和偏好行为。

0 人收藏 0 人点赞
#llm-alignment

SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation

arXiv cs.LG ↗ · 2026-08-05 缓存

SMOPD proposes a two-stage specialize-and-merge online policy distillation method to improve multi-reward reinforcement learning, addressing issues with sparse and dense reward signals where GDPO struggles. It outperforms GDPO across 1.5B, 3B, and 7B backbones in complementary and conflicting reward settings.

0 人收藏 0 人点赞
#llm-alignment

端到端学习标量奖励模型的潜在推理轨迹

arXiv cs.CL ↗ · 2026-08-03 缓存

提出 LatentRM,一种奖励建模框架,将中间推理轨迹作为离散潜在变量学习,以显式最大化下游标量奖励似然,从而改进分布内和分布外任务上的偏好建模与策略对齐。

0 人收藏 0 人点赞
#llm-alignment

Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL

arXiv cs.AI ↗ · 2026-08-03 缓存

This paper proposes PRISM, a multi-reward RL framework that decomposes policy space rather than mixing rewards, improving multi-reward optimization and enabling inference-time controllability. Experiments on reasoning and alignment tasks show it outperforms existing baselines.

0 人收藏 0 人点赞
#llm-alignment

面向人类反馈强化学习的元学习奖励塑造

arXiv cs.LG ↗ · 2026-07-30 缓存

MeRLa 是一个用于 RLHF 的元学习奖励塑造框架,通过学习任务特定的塑造函数来改善对齐,在多个基准上取得了最先进的结果,并显著降低了训练不稳定性。

0 人收藏 0 人点赞
#llm-alignment

更少数据,更好对齐:数据驱动的多评估者一致性偏好优化

arXiv cs.AI ↗ · 2026-07-29 缓存

本文介绍了DMAPO,一种偏好优化方法,利用多评估者共识来选取高置信度的在策略响应,以显著更少的数据(仅3.45%的接受率)实现强对齐,并在多个基准测试中优于SimPO等基线。

0 人收藏 0 人点赞
#llm-alignment

SyRuP:在大语言模型解码中通过奖励引导预测增强系统提示遵从

arXiv cs.CL ↗ · 2026-07-28 缓存

介绍SyRuP,一种解码时框架,它训练一个交叉注意力奖励头来为系统提示生成令牌级别的遵从分数,无需模型调优即可提高大语言模型对复杂提示的遵从性。

0 人收藏 0 人点赞
#llm-alignment

超越Shapley:一种基于影响力的LLM对齐与评估数据审计管线

arXiv cs.LG ↗ · 2026-07-28 缓存

介绍了一种可扩展的、仅需推理的数据估值管线,该管线通过近似Shapley值来审计LLM对齐数据集,将手动审计搜索空间减少了99.1%,并揭示了HelpSteer2和HH-RLHF中隐藏的标签错误。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈