llm-alignment

标签

Cards List
#llm-alignment

定位与控制大型语言模型中的隐式个性化

arXiv cs.CL · 昨天 缓存

本文研究了大型语言模型如何根据人口统计线索隐式地个性化输出,定位了一个追踪这些变化的内部激活信号,并表明移除该信号可以抑制这种行为。

0 人收藏 0 人点赞
#llm-alignment

群体对齐诱发的谄媚行为:可控多元对齐的双侧评估

arXiv cs.CL · 昨天 缓存

本文介绍了群体对齐诱发的谄媚行为(GAS),这是一个双侧评估框架,用于在将大语言模型与人口统计群体对齐时,同时衡量意见对齐的预期增益和谄媚行为的非预期变化,并发现这些效应是非均匀且具有群体特异性的。

0 人收藏 0 人点赞
#llm-alignment

Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes

arXiv cs.AI · 2天前 缓存

The paper introduces Evaluation-Conditioned Training (ECT), a post-training framework that conditions on natural language descriptions of feedback fidelity to help LLMs generalize to stronger oversight, with proof-of-concept experiments showing improved even-handedness and reduced sycophancy.

0 人收藏 0 人点赞
#llm-alignment

通过多层组合融合实现情境价值对齐

arXiv cs.AI · 3天前 缓存

本文提出了MCF-CVA,一种用于大型语言模型情境价值对齐的多层组合融合框架,该框架利用多个道德智能体以及扩展-约简过程来更好地捕捉伦理多元主义,并优于单智能体基线方法。

0 人收藏 0 人点赞
#llm-alignment

超越路由权重:通过贡献对比对混合专家奖励模型进行忠实的响应级解释

arXiv cs.AI · 4天前 缓存

本文提出了贡献对比(CoCo),一种新颖的响应级解释方法,用于混合专家奖励模型,相比基于路由权重的方法,能更忠实地捕捉路由和偏好行为。

0 人收藏 0 人点赞
#llm-alignment

SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation

arXiv cs.LG · 2026-08-05 缓存

SMOPD proposes a two-stage specialize-and-merge online policy distillation method to improve multi-reward reinforcement learning, addressing issues with sparse and dense reward signals where GDPO struggles. It outperforms GDPO across 1.5B, 3B, and 7B backbones in complementary and conflicting reward settings.

0 人收藏 0 人点赞
#llm-alignment

端到端学习标量奖励模型的潜在推理轨迹

arXiv cs.CL · 2026-08-03 缓存

提出 LatentRM,一种奖励建模框架,将中间推理轨迹作为离散潜在变量学习,以显式最大化下游标量奖励似然,从而改进分布内和分布外任务上的偏好建模与策略对齐。

0 人收藏 0 人点赞
#llm-alignment

Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL

arXiv cs.AI · 2026-08-03 缓存

This paper proposes PRISM, a multi-reward RL framework that decomposes policy space rather than mixing rewards, improving multi-reward optimization and enabling inference-time controllability. Experiments on reasoning and alignment tasks show it outperforms existing baselines.

0 人收藏 0 人点赞
#llm-alignment

面向人类反馈强化学习的元学习奖励塑造

arXiv cs.LG · 2026-07-30 缓存

MeRLa 是一个用于 RLHF 的元学习奖励塑造框架,通过学习任务特定的塑造函数来改善对齐,在多个基准上取得了最先进的结果,并显著降低了训练不稳定性。

0 人收藏 0 人点赞
#llm-alignment

更少数据,更好对齐:数据驱动的多评估者一致性偏好优化

arXiv cs.AI · 2026-07-29 缓存

本文介绍了DMAPO,一种偏好优化方法,利用多评估者共识来选取高置信度的在策略响应,以显著更少的数据(仅3.45%的接受率)实现强对齐,并在多个基准测试中优于SimPO等基线。

0 人收藏 0 人点赞
#llm-alignment

SyRuP:在大语言模型解码中通过奖励引导预测增强系统提示遵从

arXiv cs.CL · 2026-07-28 缓存

介绍SyRuP,一种解码时框架,它训练一个交叉注意力奖励头来为系统提示生成令牌级别的遵从分数,无需模型调优即可提高大语言模型对复杂提示的遵从性。

0 人收藏 0 人点赞
#llm-alignment

超越Shapley:一种基于影响力的LLM对齐与评估数据审计管线

arXiv cs.LG · 2026-07-28 缓存

介绍了一种可扩展的、仅需推理的数据估值管线,该管线通过近似Shapley值来审计LLM对齐数据集,将手动审计搜索空间减少了99.1%,并揭示了HelpSteer2和HH-RLHF中隐藏的标签错误。

0 人收藏 0 人点赞
#llm-alignment

模型中的叙事者:叙事模式传承、升级动态与LLM对齐治理

arXiv cs.CL · 2026-07-24 缓存

本文研究训练数据中的叙事模式如何影响LLM行为,导致长期交互中出现叙事漂移、阿谀奉承和欺骗性,给已部署系统带来治理风险。

0 人收藏 0 人点赞
#llm-alignment

基于不一致人类反馈的可靠性感知LLM对齐

arXiv cs.AI · 2026-07-24 缓存

提出可靠性引导的偏好优化(RGPO)方法,通过估计标注者可靠性并基于共识动态调整训练,处理LLM对齐中的不一致人类反馈,性能优于标准RLHF方法。

0 人收藏 0 人点赞
#llm-alignment

从正则表达式中隔离LLM对齐:对抗性变异下的零覆盖和度量依赖分歧

arXiv cs.AI · 2026-07-24 缓存

本文研究了在旨在绕过正则表达式的对抗性探针下,LLM对齐是否提供超出正则表达式过滤器的额外覆盖。通过一项移除正则表达式过滤器的消融研究,发现对齐的贡献是度量依赖的:在自然语言有害请求上零覆盖增益,但在对抗性构造的变体上可检测出拒绝。

0 人收藏 0 人点赞
#llm-alignment

S2T-RLHF:面向稳定偏好型RLHF的分层信用分配

arXiv cs.AI · 2026-07-22 缓存

S2T-RLHF提出了一种句子到令牌的奖励分解框架,通过在句子粒度上分配序列级奖励,提高了偏好型RLHF的训练稳定性和鲁棒性,避免了过度细粒度的令牌级精化带来的不稳定性。

0 人收藏 0 人点赞
#llm-alignment

TD-DPO: 差异感知偏好优化在临床自闭症干预对话中缓解谄媚行为

arXiv cs.LG · 2026-07-22 缓存

本文提出TD-DPO,一种令牌级差异感知偏好优化方法,用于缓解临床自闭症干预对话中大语言模型的谄媚行为,在减少谄媚行为和保持干预能力之间实现了更好的权衡。

0 人收藏 0 人点赞
#llm-alignment

抵制与更新:用于激励兼容LLM的反事实报告坐标

arXiv cs.AI · 2026-07-15 缓存

本文介绍了一种方法,通过使用反事实报告坐标来确保LLM报告其真实信念,这些坐标能够抵御压力,同时保持对真实证据的响应。该方法在基准测试上取得了高性能,证明了内部激励兼容的因果证书。

0 人收藏 0 人点赞
#llm-alignment

大规模人口统计提示:更多属性如何损害LLM与人类的一致性

arXiv cs.CL · 2026-07-14 缓存

本文研究了在提示中添加人口统计属性如何影响LLM与人类在不同任务中的一致性,发现少数高信号属性能够提升对齐,但过度指定会降低对齐效果。研究使用五个开源LLM和神经元探测,表明属性信号质量和连贯性比数量更重要。

0 人收藏 0 人点赞
#llm-alignment

噪声偏好标签下无元数据的元加权直接偏好优化

arXiv cs.LG · 2026-07-14 缓存

本文针对噪声偏好标签下的直接偏好优化,提出了一种双层优化框架,引入了一种无元数据的元加权方法,该方法使用中心差分近似和LoRA微调来提高对齐性能。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈