preference-alignment

标签

Cards List
#preference-alignment

人类对齐模型是人类模型吗?偏好对齐中的图灵测试差距

arXiv cs.AI ↗ · 5天前 缓存

本文区分了将AI与人类偏好对齐和与人类行为对齐,表明偏好对齐可能会降低拟人性,并在当前对齐方法中建立图灵测试差距。

0 人收藏 0 人点赞
#preference-alignment

LOCUS: 面向令牌高效语言生成的任务感知低秩后训练

arXiv cs.CL ↗ · 2026-09-11 缓存

LOCUS是一种任务感知低秩后训练方法,可在保持偏好对齐的同时减少语言模型的输出令牌长度,在Pythia-2.8B上实现高达39.84%的减少,且仅需最少的参数更新。

0 人收藏 0 人点赞
#preference-alignment

BridgeAlign:弥合人文与社会科学中的偏好对齐

arXiv cs.CL ↗ · 2026-07-31 缓存

BridgeAlign 提出了一种面向人文与社会科学领域的偏好对齐流水线,生成了 21 万条合成偏好样本,使 Qwen3-8B 在 17 个基准测试上取得了强劲表现。

0 人收藏 0 人点赞
#preference-alignment

关于偏好对齐生成中导向向量局限性的研究

arXiv cs.CL ↗ · 2026-07-03 缓存

本文系统研究了导向向量在受控文本生成中的局限性,发现其有效性在不同特质间存在差异,在任务迁移中会退化,并面临组合权衡问题。

0 人收藏 0 人点赞
#preference-alignment

PAPA:在线个性化主动偏好对齐

arXiv cs.LG ↗ · 2026-07-02 缓存

本文介绍了个性化主动偏好对齐(PAPA),一种无需参数化奖励模型、利用实时用户反馈微调扩散模型的方法,提高了推荐和图像生成等个性化任务的效率。

0 人收藏 0 人点赞
#preference-alignment

\textsc{DiARC}: 区分正负样本有助于提升大语言模型的类ARC推理能力

arXiv cs.CL ↗ · 2026-06-26 缓存

DiARC是一种方法,通过从正负样本构建偏好对来提升大语言模型在类ARC任务上的推理能力,在多个基准测试中优于基线模型。

0 人收藏 0 人点赞
#preference-alignment

CHILLGuard:面向细粒度中文大模型安全护栏的可扩展数据构建与模型感知偏好对齐

arXiv cs.CL ↗ · 2026-06-16 缓存

本文介绍了CHILLGuard,一个基于新的5大类、31小类风险分类体系和可扩展多阶段数据构建流程的细粒度中文大模型内容安全护栏。该模型实现了最先进的性能,在F1分数上相比现有基线提升了15.92%。

0 人收藏 0 人点赞
#preference-alignment

TuneJury: 一个用于改进音乐生成偏好对齐的开放度量

Hugging Face Daily Papers ↗ · 2026-06-15 缓存

TuneJury 是一个开源的成对奖励模型,用于文本到音乐生成,提供校准的偏好评分,并泛化到多个下游应用。

0 人收藏 0 人点赞
#preference-alignment

Spectral Souping:在线偏好对齐的统一框架

arXiv cs.LG ↗ · 2026-05-21 缓存

本文介绍了Spectral Souping,这是一种通过发现通用谱表示来高效对齐LLM与个体用户偏好的框架,该表示能在推理时合并专门策略,无需昂贵的重新训练。

0 人收藏 0 人点赞
#preference-alignment

用于人类图像动画的隐式偏好对齐

Hugging Face Daily Papers ↗ · 2026-05-08 缓存

本文介绍了隐式偏好对齐(IPA),这是一种数据高效的训练后框架,可在无需成对偏好数据的情况下改善人类图像动画中的手部动作生成。它利用隐式奖励最大化和手部感知的局部优化来提高生成质量,同时降低数据整理成本。

0 人收藏 0 人点赞
#preference-alignment

Arch-Router:将LLM路由与人类偏好对齐

Papers with Code Trending ↗ · 2025-06-19 缓存

Arch-Router是一个紧凑型1.5B参数模型,通过将查询映射到用户定义的领域和动作类型,将LLM路由与人类偏好对齐,在主观评估中优于专有模型。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈