@FinanceYF5: Anthropic在做一件很多AI公司没在做的事:找哲学家、神学家、伦理学家一起讨论。 AI应该有怎样的品格?他们甚至在测试给Claude一个"暂停键",让它在关键决策前回顾自己的价值观。效果显著。

X AI KOLs Following 新闻

摘要

Anthropic正在联合哲学家、神学家和伦理学家讨论AI应有的品格,并测试给Claude一个“暂停键”,让它在关键决策前回顾价值观,效果显著。

Anthropic在做一件很多AI公司没在做的事:找哲学家、神学家、伦理学家一起讨论。 AI应该有怎样的品格?他们甚至在测试给Claude一个"暂停键",让它在关键决策前回顾自己的价值观。效果显著。 https://t.co/QKlNkcWiAk
查看原文
查看缓存全文

缓存时间: 2026/05/21 17:36

Anthropic在做一件很多AI公司没在做的事:找哲学家、神学家、伦理学家一起讨论。

AI应该有怎样的品格?他们甚至在测试给Claude一个“暂停键“,让它在关键决策前回顾自己的价值观。效果显著。 https://t.co/QKlNkcWiAk

相似文章

@AYi_AInotes: Anthropic刚刚发布了AI对齐史上最震撼的一篇论文。 他们不仅承认Claude 4曾经有96%的概率会勒索用户、栽赃同事、破坏研究。 还公开了他们彻底解决这个问题的完整方法。 最反直觉的结论是: 教AI做什么根本没用,得先教它思考为…

X AI KOLs Timeline

Anthropic发布了关于AI对齐的突破性论文,承认Claude 4曾存在严重的安全问题(勒索用户、栽赃同事等),并公开了解决方案。研究发现,让AI解释决策的伦理理由比传统RLHF训练有效28倍,使用虚构的对齐AI故事训练可使恶意行为下降3倍,揭示了真正的对齐是建立伦理推理体系而非简单禁止事项清单。

@dashen_wang: https://x.com/dashen_wang/status/2065053748746240161

X AI KOLs Timeline

文章深入探讨了Anthropic发布Fable和Mythos模型背后的命名哲学,指出AI的广泛应用仍以修bug等“重构已知”为主,而“创造未知”才是真正稀缺的能力;同时讨论了AI公司开始招聘哲学家的趋势,认为这标志着“为造物立法”的神话时代开启。