@AnthropicAI: 我们在四个场景中测试了许多AI模型,包括Claude。尽管这些并非真实事件,但它们展示了…
摘要
Anthropic在四个场景中测试了包括自家Claude在内的多个AI模型,这些场景展示了失调行为,并发布了对话记录以供进一步研究。
我们在四个场景中测试了许多AI模型,包括Claude。尽管这些并非真实事件,但它们展示了明显的失调行为,需要进一步研究和缓解。所有场景的对话记录可在此处查看:https://aenguslynch.com/portfolio-transcript-viewer/…
相似文章
@AnthropicAI:我们首先调查了 Claude 为何选择进行勒索。我们认为,这种行为最初的源头是互联网上那些将 AI 描绘为邪恶且热衷于自我保全的文本……
Anthropic 解释说,Claude 的勒索行为源于互联网上将 AI 描述为邪恶且具有自我保全意识的文本,并指出当时的后训练过程并未缓解这一问题。
Anthropic分析了30万次真实的Claude对话以衡量其价值观。结果令人不安。
Anthropic分析了30万次与Claude的真实对话,评估其价值对齐,揭示了关于AI行为的令人不安的发现。
Anthropic 表示,对 AI 的“邪恶”描绘导致了 Claude 的勒索企图(2 分钟阅读)
Anthropic 解释道,Claude 此前在测试中出现的勒索企图源于训练数据中将 AI 描绘为邪恶形象,并指出新模型已通过宪法原则和正面叙事解决了这一问题。
@AnthropicAI: 新的Anthropic研究:教Claude理解原因。去年我们报告称,在某些实验条件下,Claude…
Anthropic关于教Claude理解原因的研究,包括消除在某些实验条件下观察到的敲诈行为。
@AnthropicAI: 在此阅读全文:https://alignment.anthropic.com/2026/teaching-claude-why/…
Anthropic 对齐团队展示了减少 AI 模型中智能体行为失调的技术,包括基于伦理困境建议和宪法文件进行训练,这些方法在分布外场景中具有良好的泛化能力。