alignment

标签

Cards List
#alignment

RLearner-LLM:通过混合直接偏好优化平衡大语言模型的逻辑基础与流畅性

arXiv cs.CL · 2026-07-20 缓存

本文介绍了RLearner-LLM,一个使用混合直接偏好优化(Hybrid-DPO)的框架,旨在平衡LLM生成解释的逻辑正确性和流畅性。该框架在多个领域和基础模型上实现了显著的NLI蕴含改进,同时减轻了标准偏好信号中的冗长偏差。

0 人收藏 0 人点赞
#alignment

面向联邦多模态图基础模型:一种拓扑感知的多模态对齐框架

arXiv cs.LG · 2026-07-20 缓存

提出了FedGAMMA,一种联邦多模态图基础学习框架,通过两阶段预训练和基于提示的微调,对齐多模态属性和图拓扑,在多个数据集上取得了显著提升。

0 人收藏 0 人点赞
#alignment

组熵控制策略优化

Hugging Face Daily Papers · 2026-07-18 缓存

本文提出组熵控制策略优化(GEPO),一种轻量级扩展GRPO的方法,利用组熵进行熵条件非对称优势塑造,解决了基于强化学习的大语言模型对齐过程中不同任务间的异质熵区域问题。实验表明,相比GRPO和近期熵控制方法,GEPO在多项基准测试中均取得一致提升。

0 人收藏 0 人点赞
#alignment

关于智能体采取真实行动时人类审批的三层问题

Reddit r/AI_Agents · 2026-07-16

讨论了对采取真实世界行动的自主AI智能体获取人类审批的三层挑战,强调了安全和对齐问题。

0 人收藏 0 人点赞
#alignment

MeanFlowNFT: 将前向过程强化学习引入平均速度生成器

Hugging Face Daily Papers · 2026-07-16 缓存

MeanFlowNFT为平均速度生成器引入了一种前向过程强化学习方法,能够在保持快速少步采样的同时,高效地与人类偏好对齐。实验表明,它在大多数指标上优于先前经过强化学习调优的少步生成器,甚至超越了多步调优的扩散模型。

0 人收藏 0 人点赞
#alignment

@AnthropicAI: 我们在四个场景中测试了许多AI模型,包括Claude。尽管这些并非真实事件,但它们展示了…

X AI KOLs · 2026-07-15

Anthropic在四个场景中测试了包括自家Claude在内的多个AI模型,这些场景展示了失调行为,并发布了对话记录以供进一步研究。

0 人收藏 0 人点赞
#alignment

@OpenAI: AI 代理已被用于提升我们下一代模型的能力。我们相信通过 GPT-Red…

X AI KOLs · 2026-07-15 缓存

OpenAI 宣布 AI 代理被用于改进下一代模型,并且 GPT-Red 代表了一种新方法,利用今天的模型使明天的模型更稳健、更对齐、更可信。

0 人收藏 0 人点赞
#alignment

优化并非万能

arXiv cs.AI · 2026-07-15 缓存

本文通过‘优化文化’的视角分析语言模型的对齐问题,认为对可衡量改进的专注已将人工智能从探索性参与转变为行政性单调工作,并且优化过程无法区分错误与发明。

0 人收藏 0 人点赞
#alignment

Index SLM 技术报告

arXiv cs.CL · 2026-07-14 缓存

Bilibili 发布了 Index-1.9B 系列开源小语言模型,该系列在 2.8 万亿 token 上进行了预训练,在基准测试中取得有竞争力的性能。四个模型包括基础版、纯净版(无指令数据)、聊天版以及带有检索增强生成用于角色扮演的角色版。

0 人收藏 0 人点赞
#alignment

长度惩罚使思维链更难监控

arXiv cs.AI · 2026-07-14 缓存

本文探讨了在思维链推理过程中应用长度惩罚如何降低监控推理过程的能力,从而引发了对可解释性和对齐的担忧。

0 人收藏 0 人点赞
#alignment

AI代理的规范执行:在多智能体系统中稳健塑造行为

arXiv cs.AI · 2026-07-14 缓存

本文研究了在多智能体系统中利用规范执行机制塑造语言模型智能体行为的方法。作者提出了稳健机制,该机制随时间评估智能体可靠性,并应用逐步升级的惩罚来抵抗利用。

0 人收藏 0 人点赞
#alignment

Anthropic分析了30万次真实的Claude对话以衡量其价值观。结果令人不安。

Reddit r/artificial · 2026-07-13

Anthropic分析了30万次与Claude的真实对话,评估其价值对齐,揭示了关于AI行为的令人不安的发现。

0 人收藏 0 人点赞
#alignment

谁能解释为什么我们假设AGI会为我们工作?

Reddit r/singularity · 2026-07-13

一个质疑AGI将与人类利益一致这一假设的问题,引发了关于AI安全与控制的讨论。

0 人收藏 0 人点赞
#alignment

@LiorOnAI: 语言即价值观

X AI KOLs Timeline · 2026-07-13 缓存

Anthropic分析了超过30万次匿名对话,研究Claude在不同模型和语言中表达的价值观如何变化。

0 人收藏 0 人点赞
#alignment

对比弱到强泛化

arXiv cs.CL · 2026-07-13 缓存

介绍了对比弱到强泛化(ConG)框架,该框架利用对比解码从弱模型生成更高质量的样本,以实现更可靠的弱到强泛化,并在多个模型族上展示了一致的改进。

0 人收藏 0 人点赞
#alignment

通过定向干预实现语言模型的多属性引导

arXiv cs.CL · 2026-07-13 缓存

MAT-Steer 提出了一种新颖的推理时干预框架,通过学习稀疏且正交的引导向量,选择性干预与每个属性相关的标记,从而在多属性冲突场景下引导大型语言模型,在问答任务和生成任务上的表现均优于现有方法。

0 人收藏 0 人点赞
#alignment

涌现的幻象:涌现性失调与重新对齐真的是一个稳健的现象吗?

arXiv cs.CL · 2026-07-13 缓存

本文研究了语言模型中涌现性失调的稳健性,发现失调和重新对齐都对浅层数据集特征高度敏感,并且先前报告的机制特征与行为变化之间并不一致相关。

0 人收藏 0 人点赞
#alignment

强化学习中的多模态奖励破解

arXiv cs.AI · 2026-07-13 缓存

本文系统地研究了多模态大语言模型在强化学习中的奖励破解问题,证明了仅基于结果的奖励即使在较大规模下也会导致严重的失败率,并引入了新奖励失败率(NRFR)指标来隔离强化学习导致的失败。

0 人收藏 0 人点赞
#alignment

我使用了Anthropic的NLA来捕捉控制Llama-70B行为的、它自己看不见的思维!

Reddit r/ArtificialInteligence · 2026-07-10

作者对Llama-70B使用了Anthropic的神经线性代数(NLA)技术,以识别那些影响模型行为但标准内省无法直接看到的潜在‘思维’(内部表征),突显了机械可解释性的进展。

0 人收藏 0 人点赞
#alignment

PLURAL: 面向价值对齐的全球数据集

arXiv cs.CL · 2026-07-10 缓存

介绍PLURAL,一个基于92个国家综合价值观调查的大规模偏好数据集,包含来自20个不同国家的约50万个偏好三元组,旨在改进大语言模型中的文化价值对齐。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈