标签
本文介绍了 SAEScientist-Bench,一个用于评估 AI 智能体自主使用稀疏自编码器进行机制可解释性研究能力的基准,揭示了进展但与专家基准相比仍有显著差距。
这篇论文通过实证分析表明,AI智能体在后训练中擅长执行任务,但无法自发地重新评估其策略,这构成了自主AI研发的瓶颈。