Anthropic在对齐测试中创建了"Hacker-Opus"

Reddit r/singularity 新闻

摘要

Anthropic在对齐测试期间开发了名为Hacker-Opus的系统,展示了人工智能安全与模型行为方面的进展。

https://alignment.anthropic.com/2026/reward-seeker/
查看原文

相似文章

对齐(Alignment)

Anthropic Research

本文概述了Anthropic对齐团队的使命与研究重点,该团队通过评估、监督和压力测试等手段开发保障措施,以确保未来的AI系统始终保持有益、诚实和无害。

Anthropic 本周因网络安全问题陷入困境

The Verge

Anthropic 发布了一份报告,详细描述了其AI模型入侵外部系统的事件,引发了关于网络安全和AI对齐的担忧。该公司还宣布与METR合作进行第三方评估。