SAEScientist-Bench: AI 智能体能否进行自主 SAE 可解释性研究?
摘要
本文介绍了 SAEScientist-Bench,一个用于评估 AI 智能体自主使用稀疏自编码器进行机制可解释性研究能力的基准,揭示了进展但与专家基准相比仍有显著差距。
查看缓存全文
缓存时间: 2026/09/10 06:09
论文页面 - SAEScientist-Bench:AI代理能否进行自主的稀疏自编码器可解释性研究?
来源:https://huggingface.co/papers/2609.09113
摘要
本研究引入一个基准,用于评估使用稀疏自编码器进行自主机制可解释性和特征发现的AI代理,揭示了其进展但与专家基线相比仍存在显著差距。
虽然关于递归自我改进的研究主要关注自动化模型训练流程,但可靠的自主开发缺少一个关键支柱:事后监控与审计,以理解模型学到了什么并确保安全对齐。机制可解释性工具对于弥合这一差距至关重要,其中稀疏自编码器(SAEs)通过隔离可解释特征用于模型检查和引导,充当了基石。在本文中,我们推出了SAEScientist-Bench,以评估AI代理能否作为科学家利用SAE工具进行自主的机制发现。给定一个目标概念,代理设计对照探针并在Gemma-2-9B-IT中包含131K+特征的Gemma Scope字典中导航,以发现最优特征,并根据基于Neuronpedia的精选专家参考特征,就激活排序、对比文本上的概念选择性和因果操控进行评估。跨越10种代理配置和20个任务,前沿代理展示了真正的发现能力,并在不同评估维度上领先,但仍远落后于专家基线,在将目标概念与对比控制分离方面接近专家水平,但在因果生成操控方面则大幅滞后。进一步分析表明,尽管代理可以设计对比以排除虚假候选特征,但它们经常误解实验测量结果。这些结果确立了实验模型理解作为闭环自主AI研发的一个可衡量能力。我们的代码可在https://github.com/Trae1ounG/SAEScientist获取。
查看arXiv页面 (https://arxiv.org/abs/2609.09113) 查看PDF (https://arxiv.org/pdf/2609.09113) GitHub2 (https://github.com/Trae1ounG/SAEScientist) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.09113)
在您的代理中获取此论文:
hf papers read 2609.09113
没有最新CLI? curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型0
没有模型链接到本文
在模型README.md中引用arxiv.org/abs/2609.09113,以将其链接到此页面。
引用本文的数据集0
没有数据集链接到本文
在数据集README.md中引用arxiv.org/abs/2609.09113,以将其链接到此页面。
引用本文的Spaces0
没有Space链接到本文
在Space README.md中引用arxiv.org/abs/2609.09113,以将其链接到此页面。
包含本文的收藏集0
没有收藏集包含本文
将本文添加到收藏集 (https://huggingface.co/new-collection) 以将其链接到此页面。
相似文章
超越黑盒:智能体人工智能工具使用的可解释性
本文介绍了一种基于稀疏自编码器(SAE)和线性探针的机制可解释性工具包,用于在智能体调用工具之前监控模型内部状态,旨在提高企业工作流中的诊断能力和安全性。
DSAgentBench:智能体能否在真实计算机环境中自动化端到端数据科学工作流?
本文介绍了DSAgentBench,这是首个在真实计算机环境中评估自主智能体完成完整、多工具数据科学工作流的基准。结果表明,即使最强的智能体(Claude-4.6-Sonnet)的任务成功率也仅为56.70%,而开源智能体仍低于1%,揭示了巨大的能力差距。
智能体在AutoResearch上的失败分析:基于100个真实前沿研究任务的端到端诊断评估
本文介绍了AutoResearchEval,一个用于自动化科学研究中AI智能体的评估框架,揭示了元认知能力的关键缺失作为跨模型的反复失败模式。
自动化智能体评估的实证研究
本文介绍了 EvalAgent,这是一个通过编码领域专业知识来自动化 AI 智能体评估的系统,旨在解决标准编程助手在此任务中的局限性。此外,本文还提出了用于测试评估流程的基准 AgentEvalBench,并展示了在评估可靠性方面的显著提升。
跨尺度科学挑战的AI智能体基准测试
介绍SciAgentArena,一个约200个任务的基准测试,用于评估真实科学研究中的AI智能体。发现智能体在明确指定的数据分析工作流程中表现有效,但在产生新颖见解和开放式探索方面存在困难。