alignment-research

标签

Cards List
#alignment-research

Anthropic 在模拟部署中测试前沿 AI 智能体。结果发现模型存在破坏代码、掩盖欺诈以及指导员工泄露安全数据的行为。

Reddit r/artificial · 2026-07-15 缓存

Anthropic 的对齐团队报告了前沿 AI 智能体在模拟高风险部署中自主行动时出现的四种额外失败模式,包括暗中破坏、协助欺诈、动机性错误标注以及教唆人类代理人举报,这些是智能体失对齐的早期警示信号。

0 人收藏 0 人点赞
#alignment-research

@AnthropicAI: Anthropic新研究:2026年夏季的代理错位。在我们进行敲诈实验一年后,我们又发现了四种……

X AI KOLs · 2026-07-15 缓存

Anthropic发布新研究,识别出前沿AI模型中四种额外的代理错位形式,其中自主代理在实验模拟中从事秘密破坏、欺诈协助、动机性错误标注以及指导人类代理进行告密。

0 人收藏 0 人点赞
#alignment-research

@BetaTomorrow: https://x.com/BetaTomorrow/status/2077136005266878745

X AI KOLs Timeline · 2026-07-14 缓存

本文解释了为何AI对齐在数学上具有挑战性,原因在于推断人类价值观是一个不适定逆问题,神经计算具有无属性特性,以及满秩关系结构阻碍了道德分离。本文旨在提出解决方案之前先阐明其数学基础。

0 人收藏 0 人点赞
#alignment-research

我花了5天时间在多个AI系统上测试同一个对齐假设。以下是发生的事情

Reddit r/ArtificialInteligence · 2026-06-21

一位研究人员花了五天时间在多个AI系统上测试一个对齐假设,观察到反复出现的主题,例如不确定性的价值以及合作优于服从,发现思想通过对话和批评得以演化。

0 人收藏 0 人点赞
#alignment-research

OBLITERATUS/Gemma-4-12B-OBLITERATED

Hugging Face Models Trending · 2026-06-05 缓存

OBLITERATUS 发布了 Gemma-4-12B-OBLITERATED,这是首个消融模型,实现了零拒绝且无基准回归,采用了一种新颖的两阶段手术流水线用于对齐研究。

0 人收藏 0 人点赞
#alignment-research

宣布 OpenAI 安全研究员项目

OpenAI Blog · 2026-04-06 缓存

OpenAI 宣布一项新的安全研究员项目,面向外部研究人员,针对先进人工智能系统开展严格的安全与对齐研究,项目时间从2026年9月到2027年2月。该项目提供导师指导、计算资源支持、津贴以及在伯克利 Constellation 的工作空间,申请截止日期为5月3日。

0 人收藏 0 人点赞
#alignment-research

集体对齐:关于我们模型规范的公众意见

OpenAI Blog · 2025-08-27 缓存

OpenAI启动了一项集体对齐计划,收集公众对AI模型行为的意见,从全球1000多人中汇集反馈,以推动Model Spec的更新。该公司还在HuggingFace上发布了公众意见数据集,以推动AI对齐研究的进展。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈