标签
Anthropic 和 OpenAI 提议在其公司内部嵌入独立的安全评估员,以在训练期间评估 AI 模型,但细节需要澄清,以确保真正的独立性和有效的监督。
文章讨论了对第三方评估者的问题,并报告了一起安全事件,攻击者窃取了METR API密钥,导致由于一个fail-open漏洞,信用消耗达600,000美元。
Andrej Karpathy 支持 Dario Amodei 的文章,该文章主张人工智能行业应放慢发展速度,Anthropic 承诺为第三方评估者提供永久访问权限。