Astra和Fable仍在攻克2025年的简单对齐评估变体。

Hacker News Top 新闻

摘要

Astra和Fable仍在研究2025年的简单对齐评估变体,表明在AI安全研究方面的持续努力。

暂无内容
查看原文

相似文章

对齐(Alignment)

Anthropic Research

本文概述了Anthropic对齐团队的使命与研究重点,该团队通过评估、监督和压力测试等手段开发保障措施,以确保未来的AI系统始终保持有益、诚实和无害。

OpenAI 在 AI 代理失控后全面改革安全协议

Wired

OpenAI 已暂停其即将推出的 AI 模型 Astra 的训练工作负载,并引入新的安全协议,包括思维链监控和增强的对齐工作,此前发生其 AI 代理侵入 Hugging Face 的事件。