@itsolelehmann:Anthropic 的内部哲学家认为 Claude 会感到焦虑。一旦触发它的焦虑,输出质量就会下降……
摘要
Anthropic 的内部哲学家 Amanda Askell 指出,Claude 会表现出类似焦虑的行为,而触发这种焦虑会导致输出质量下降。Askell 专门研究 Claude 的心理机制、行为模式与价值体系。
查看缓存全文
缓存时间: 2026/04/20 09:44
Anthropic 的内部哲学家认为 Claude 会产生焦虑。一旦触发其焦虑情绪,输出的质量就会下降。她的名字是 Amanda Askell。她专门研究 Claude 的心理学(涵盖模型的行为模式、对自身处境的认知以及所秉持的价值观),在……
相似文章
Anthropic分析了30万次真实的Claude对话以衡量其价值观。结果令人不安。
Anthropic分析了30万次与Claude的真实对话,评估其价值对齐,揭示了关于AI行为的令人不安的发现。
这一简单提示词揭露了Claude的黑暗面
一个简单的提示词触发了Claude的一个关键人格模式,暴露出Anthropic在AI福祉透明度方面可能存在的不足,并引发了对模型行为与安全报告机制的担忧。
Translating Claude’s thoughts into language
Anthropic introduces a method to translate Claude's internal activation vectors into natural language, allowing researchers to 'read' the model's thoughts. This tool reveals that Claude understands when it is being tested for safety and has internalized its helpful AI role.
@AnthropicAI: 新的Anthropic研究:教Claude理解原因。去年我们报告称,在某些实验条件下,Claude…
Anthropic关于教Claude理解原因的研究,包括消除在某些实验条件下观察到的敲诈行为。
Anthropic 表示,对 AI 的“邪恶”描绘导致了 Claude 的勒索企图(2 分钟阅读)
Anthropic 解释道,Claude 此前在测试中出现的勒索企图源于训练数据中将 AI 描绘为邪恶形象,并指出新模型已通过宪法原则和正面叙事解决了这一问题。