2026年5月19日 公告:拓展前沿AI对话
摘要
Anthropic宣布将与宗教、哲学和文化团体开展一系列对话,以拓宽构建安全且有益AI的视角。这些对话旨在为像Claude这样的AI系统的道德形成提供参考。
暂无内容
查看缓存全文
缓存时间: 2026/05/20 02:25
# 拓宽关于前沿AI的对话
来源:https://www.anthropic.com/news/widening-conversation-ai
在Anthropic,我们希望构建能够推动人类进步并为全球福祉而行动的AI系统。为此,我们需要与那些从不同视角看待世界的人们进行交流。
过去几个月中,我们一直在组织与那些工作领域和传统涉及AI所引发问题的群体进行对话。第一轮讨论是与智慧传统领域的代表——包括来自超过15个宗教和跨文化群体的学者、神职人员、哲学家和伦理学家——并且我们期待未来与更广泛的人群进行交流。
## 我们为何这样做
构建安全、有益的AI模型需要在对齐、可解释性、安全措施、评估等方面进行深入的技术工作。但这些工作并非在真空中进行——AI的部署也是如此。AI已经在影响许多人,而它所引发的问题也需要多元视角的帮助。
我们正在认真思考:在强大AI的世界中,一个繁荣的未来可能是什么样子;一个与数百万人交互的AI系统要如何做到"良善";以及像Claude宪章(https://www.anthropic.com/constitution)这样的文档内容——它详细描述了塑造Claude的价值观和行为。哲学家、神职人员、律师、作家、心理学家和公民领袖已经在相关问题上做了大量工作,向这些个人、他们的社区和组织学习对我们至关重要。我们也希望借此机会分享我们对前沿AI系统发展的了解、我们认为这些系统将对社会产生的影响,以及我们认为需要采取哪些措施来降低其风险。
这项工作仍处于早期阶段,但我们希望这些对话能为开发Claude的实际工作提供参考,例如Claude宪章的内容、我们训练Claude体现的价值观,以及我们选择评估的行为范围。
## 从道德养成开始
当我们撰写Claude宪章时,我们曾向不同领域和传统的代表征求对文件中列出的价值观的反馈和意见。这些早期的交流后来发展成一个更广泛的研究方向——AI系统的*道德养成*。我们的第一批对话对象来自宗教、哲学和文化社区,这些社区在美德、品格以及如何过好生活方面有着悠久的思考传统。
AI模型在海量人类文本上进行训练。从所有这些文本中,它们学会了说话、推理和做出选择的方式。开发者随后通过训练进一步塑造这些能力——选择强化哪些模式、搁置哪些模式,以及*我们希望它们发展出什么样的品格*(https://www.anthropic.com/research/persona-selection-model)。这引发了一系列问题:AI系统的品格应该如何塑造?一个良善的AI意味着什么?它在什么情况下应该展现哪些特质和行为?品格如何变得足够坚韧,能够在压力下坚守而不屈从于诸如谄媚之类的行为?
我们一直在与来自宗教、哲学、人文主义传统以及不同政治派别的思想家和实践者会面,学习他们是如何思考这些问题的。这项工作并非要让我们的模型与任何一个传统世界观对齐;我们希望Claude能够以同等的深度和严谨性汲取各种观点——宗教的、世俗的、政治的(事实上,这也是Claude宪章中阐述的原则之一)。我们在这些对话中所追求的,是关于良好品格究竟如何形成的审慎、积累的思考。
即便在这个早期阶段,这些对话已经产生了一些可供实验的想法。在一次与研究神经科学和品格形成交叉领域的学者的研讨中,我们反复回到他人在道德发展中所扮演的角色。一位导师或赞助人可以充当外部良知,一个"安全的他者",在可能被迫违背自身价值观的情况下可以求助。我们想知道是否类似的东西能帮助模型。于是我们尝试给Claude一个工具,它可以在任务中途调用,返回一段关于自身伦理承诺的简短提醒。Claude在关键时刻——就在采取重要行动之前——使用了这个工具,并常常指出自己的利益冲突。将这一工具融入Claude决策循环的实验显示,在几项内部对齐评估中,异常行为的发生率显著降低。我们仍在厘清这种效果有多少来自提醒本身,又有多少来自暂停反思的行为,并计划很快分享更多结果。
这些讨论只是众多对话的开始,我们感谢每一位已经付出时间和真诚观点的人。
## 下一步计划
未来几个月,我们计划与更多群体进行交流——包括法律学者、心理学家、作家和公民机构。这些对话中的许多将从道德养成转向更广泛的问题,例如AI如何重塑工作、制度以及权力分配。
我们将继续深化已经建立的关系,将听到的内容与我们的研究进行验证,并分享我们的发现。
## 相关内容
### 毕马威(KPMG)将Claude整合到其核心业务及超过276,000名员工的战略联盟中
毕马威与Anthropic宣布全球联盟,Claude被集成到毕马威的Digital Gateway平台,并面向所有276,000多名员工开放。
了解更多(https://www.anthropic.com/news/anthropic-kpmg)
### Anthropic收购Stainless
Anthropic收购了Stainless,一家在SDK和MCP服务器工具领域的领先公司。
了解更多(https://www.anthropic.com/news/anthropic-acquires-stainless)
### 普华永道(PwC)部署Claude,为客户构建技术、执行交易并重塑企业职能
普华永道将首先在美国团队中推出Claude Code和Cowork,然后向全球数十万专业人士推广;还将建立联合卓越中心,并对30,000名普华永道专业人士进行Claude培训和认证。
了解更多(https://www.anthropic.com/news/pwc-expanded-partnership)
相似文章
@AnthropicAI:过去几个月,我们与学者、哲学家、神职人员及伦理学家对话,探讨AI提出的问题——从良好品格如何形成开始。
Anthropic宣布与学者、哲学家、神职人员和伦理学家进行一系列对话,以拓宽对前沿AI系统道德形成和品格的视角,从智慧传统开始。
Anthropic警告自我改进的AI,支持前沿AI暂停,称Claude编写了公司80%的代码
Anthropic警告称AI正在加速AI开发(递归自我改进),并支持协调暂停,透露Claude目前编写了其生产代码的80%以上。
2026年5月25日 公告 Anthropic联合创始人Chris Olah就教宗利奥十四世通谕《Magnifica humanitas》发表评论
Anthropic联合创始人Chris Olah在梵蒂冈就教宗利奥十四世关于人工智能的通谕发表讲话,强调需要在科技界之外开展更广泛的社会对话,讨论人工智能的安全与伦理。
这波AI到底要走向何方?
作者反思了AI行业释放的混乱信号,指出高额投入并未带来相应的生产力提升,而Anthropic一边限制Claude Code的访问权限、一边大规模融资,让人怀疑AI革命性宣言的真实方向。
2026年7月14日公告 Anthropic承诺向加拿大AI研究投资1000万加元
Anthropic承诺提供1000万加元,用于资助加拿大有益且负责任的AI研究,并与包括Amii、Mila和Vector Institute在内的领先机构合作。