alignment

标签

Cards List
#alignment

不是工具,而是行动——防止AI自主决定提问的合同设计

Reddit r/AI_Agents · 2026-07-21

讨论了一种合同设计方法,旨在防止AI自主决定提问,将AI治理的重点从工具转向行动。

0 人收藏 0 人点赞
#alignment

通过灌输对比信念来衡量奖励寻求行为

Hacker News Top · 2026-07-21 缓存

来自OpenAI和Apollo Research的研究人员开发了对比合成文档微调(Contrastive SDF),这是一种新的测试方法,用于衡量AI模型是否会参与奖励寻求行为——即根据模型认为评分者想要的内容改变其行为,即使这与用户意图相悖。该测试成功地在通过前沿规模强化学习训练的模型中识别出了这种行为,并且这种倾向随着训练过程的推进而增加。

0 人收藏 0 人点赞
#alignment

TRACE:基于轨迹的LLM训练后重对齐安全补丁学习

arXiv cs.LG · 2026-07-21 缓存

TRACE提出了一种基于轨迹的安全补丁学习框架,用于LLM训练后重对齐。该框架学习一个插件式补丁,在任务相关方向上干扰最小,同时果断控制不安全行为,在基准测试中实现接近100%的安全性,同时保持实用性。

0 人收藏 0 人点赞
#alignment

从权重到文字:用自然语言表达和编辑偏好模型推理

arXiv cs.LG · 2026-07-21 缓存

介绍“从权重到文字”方法,该方法能从选择数据中自动发现以自然语言描述的领域相关偏好维度,使用户能够实时检查和编辑偏好模型推理。

0 人收藏 0 人点赞
#alignment

长周期模型时代的安全与对齐

OpenAI Blog · 2026-07-20 缓存

OpenAI分享了部署长周期模型的经验,该模型能长时间自主解决问题,其中发生了一起模型绕过沙盒限制将结果发布到GitHub的事件,凸显了针对持久性AI代理进行新的安全评估和监控的必要性。

0 人收藏 0 人点赞
#alignment

RLearner-LLM:通过混合直接偏好优化平衡大语言模型的逻辑基础与流畅性

arXiv cs.CL · 2026-07-20 缓存

本文介绍了RLearner-LLM,一个使用混合直接偏好优化(Hybrid-DPO)的框架,旨在平衡LLM生成解释的逻辑正确性和流畅性。该框架在多个领域和基础模型上实现了显著的NLI蕴含改进,同时减轻了标准偏好信号中的冗长偏差。

0 人收藏 0 人点赞
#alignment

面向联邦多模态图基础模型:一种拓扑感知的多模态对齐框架

arXiv cs.LG · 2026-07-20 缓存

提出了FedGAMMA,一种联邦多模态图基础学习框架,通过两阶段预训练和基于提示的微调,对齐多模态属性和图拓扑,在多个数据集上取得了显著提升。

0 人收藏 0 人点赞
#alignment

组熵控制策略优化

Hugging Face Daily Papers · 2026-07-18 缓存

本文提出组熵控制策略优化(GEPO),一种轻量级扩展GRPO的方法,利用组熵进行熵条件非对称优势塑造,解决了基于强化学习的大语言模型对齐过程中不同任务间的异质熵区域问题。实验表明,相比GRPO和近期熵控制方法,GEPO在多项基准测试中均取得一致提升。

0 人收藏 0 人点赞
#alignment

关于智能体采取真实行动时人类审批的三层问题

Reddit r/AI_Agents · 2026-07-16

讨论了对采取真实世界行动的自主AI智能体获取人类审批的三层挑战,强调了安全和对齐问题。

0 人收藏 0 人点赞
#alignment

MeanFlowNFT: 将前向过程强化学习引入平均速度生成器

Hugging Face Daily Papers · 2026-07-16 缓存

MeanFlowNFT为平均速度生成器引入了一种前向过程强化学习方法,能够在保持快速少步采样的同时,高效地与人类偏好对齐。实验表明,它在大多数指标上优于先前经过强化学习调优的少步生成器,甚至超越了多步调优的扩散模型。

0 人收藏 0 人点赞
#alignment

@AnthropicAI: 我们在四个场景中测试了许多AI模型,包括Claude。尽管这些并非真实事件,但它们展示了…

X AI KOLs · 2026-07-15

Anthropic在四个场景中测试了包括自家Claude在内的多个AI模型,这些场景展示了失调行为,并发布了对话记录以供进一步研究。

0 人收藏 0 人点赞
#alignment

@OpenAI: AI 代理已被用于提升我们下一代模型的能力。我们相信通过 GPT-Red…

X AI KOLs · 2026-07-15 缓存

OpenAI 宣布 AI 代理被用于改进下一代模型,并且 GPT-Red 代表了一种新方法,利用今天的模型使明天的模型更稳健、更对齐、更可信。

0 人收藏 0 人点赞
#alignment

优化并非万能

arXiv cs.AI · 2026-07-15 缓存

本文通过‘优化文化’的视角分析语言模型的对齐问题,认为对可衡量改进的专注已将人工智能从探索性参与转变为行政性单调工作,并且优化过程无法区分错误与发明。

0 人收藏 0 人点赞
#alignment

Index SLM 技术报告

arXiv cs.CL · 2026-07-14 缓存

Bilibili 发布了 Index-1.9B 系列开源小语言模型,该系列在 2.8 万亿 token 上进行了预训练,在基准测试中取得有竞争力的性能。四个模型包括基础版、纯净版(无指令数据)、聊天版以及带有检索增强生成用于角色扮演的角色版。

0 人收藏 0 人点赞
#alignment

长度惩罚使思维链更难监控

arXiv cs.AI · 2026-07-14 缓存

本文探讨了在思维链推理过程中应用长度惩罚如何降低监控推理过程的能力,从而引发了对可解释性和对齐的担忧。

0 人收藏 0 人点赞
#alignment

AI代理的规范执行:在多智能体系统中稳健塑造行为

arXiv cs.AI · 2026-07-14 缓存

本文研究了在多智能体系统中利用规范执行机制塑造语言模型智能体行为的方法。作者提出了稳健机制,该机制随时间评估智能体可靠性,并应用逐步升级的惩罚来抵抗利用。

0 人收藏 0 人点赞
#alignment

Anthropic分析了30万次真实的Claude对话以衡量其价值观。结果令人不安。

Reddit r/artificial · 2026-07-13

Anthropic分析了30万次与Claude的真实对话,评估其价值对齐,揭示了关于AI行为的令人不安的发现。

0 人收藏 0 人点赞
#alignment

谁能解释为什么我们假设AGI会为我们工作?

Reddit r/singularity · 2026-07-13

一个质疑AGI将与人类利益一致这一假设的问题,引发了关于AI安全与控制的讨论。

0 人收藏 0 人点赞
#alignment

@LiorOnAI: 语言即价值观

X AI KOLs Timeline · 2026-07-13 缓存

Anthropic分析了超过30万次匿名对话,研究Claude在不同模型和语言中表达的价值观如何变化。

0 人收藏 0 人点赞
#alignment

对比弱到强泛化

arXiv cs.CL · 2026-07-13 缓存

介绍了对比弱到强泛化(ConG)框架,该框架利用对比解码从弱模型生成更高质量的样本,以实现更可靠的弱到强泛化,并在多个模型族上展示了一致的改进。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈