SAEScientist-Bench: AI 智能体能否进行自主 SAE 可解释性研究?

Hugging Face Daily Papers 论文

摘要

本文介绍了 SAEScientist-Bench,一个用于评估 AI 智能体自主使用稀疏自编码器进行机制可解释性研究能力的基准,揭示了进展但与专家基准相比仍有显著差距。

尽管关于递归自我改进 (RSI) 的研究主要实现了模型训练流程的自动化,但可靠的自主开发需要一个缺失的支柱:事后监控和审计以了解模型学习的内容并确保安全对齐。机制可解释性工具对于弥合这一差距至关重要,其中稀疏自编码器 (SAEs) 通过隔离可解释特征用于模型检查和导向而成为基石。在本文中,我们介绍了 SAEScientist-Bench,以评估 AI 智能体能否利用 SAE 工具充当科学家进行自主机制发现。给定一个目标概念,智能体设计对比探针并导航 Gemma-2-9B-IT 中的 Gemma Scope 字典(包含超过 131K 个特征)以发现最优特征,该特征基于 Neuronpedia 上策划的专家参考特征,在激活排名、对比文本上的概念选择性和因果导向方面进行评估。在 10 种智能体配置和 20 项任务中,前沿智能体展示了真正的发现能力并在不同评估维度上领先,但仍远落后于专家基准,在分离目标概念与对比控制方面接近专家水平,但在因果生成导向方面显著滞后。进一步分析表明,尽管智能体可以设计对比来排除虚假候选者,但他们经常误解实验测量。这些结果确立了实验模型理解作为闭环自主 AI 研发的可衡量能力。我们的代码可在 https://github.com/Trae1ounG/SAEScientist 获取。
查看原文
查看缓存全文

缓存时间: 2026/09/10 06:09

论文页面 - SAEScientist-Bench:AI代理能否进行自主的稀疏自编码器可解释性研究?

来源:https://huggingface.co/papers/2609.09113

摘要

本研究引入一个基准,用于评估使用稀疏自编码器进行自主机制可解释性和特征发现的AI代理,揭示了其进展但与专家基线相比仍存在显著差距。

虽然关于递归自我改进的研究主要关注自动化模型训练流程,但可靠的自主开发缺少一个关键支柱:事后监控与审计,以理解模型学到了什么并确保安全对齐。机制可解释性工具对于弥合这一差距至关重要,其中稀疏自编码器(SAEs)通过隔离可解释特征用于模型检查和引导,充当了基石。在本文中,我们推出了SAEScientist-Bench,以评估AI代理能否作为科学家利用SAE工具进行自主的机制发现。给定一个目标概念,代理设计对照探针并在Gemma-2-9B-IT中包含131K+特征的Gemma Scope字典中导航,以发现最优特征,并根据基于Neuronpedia的精选专家参考特征,就激活排序、对比文本上的概念选择性和因果操控进行评估。跨越10种代理配置和20个任务,前沿代理展示了真正的发现能力,并在不同评估维度上领先,但仍远落后于专家基线,在将目标概念与对比控制分离方面接近专家水平,但在因果生成操控方面则大幅滞后。进一步分析表明,尽管代理可以设计对比以排除虚假候选特征,但它们经常误解实验测量结果。这些结果确立了实验模型理解作为闭环自主AI研发的一个可衡量能力。我们的代码可在https://github.com/Trae1ounG/SAEScientist获取。

查看arXiv页面 (https://arxiv.org/abs/2609.09113) 查看PDF (https://arxiv.org/pdf/2609.09113) GitHub2 (https://github.com/Trae1ounG/SAEScientist) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.09113)

在您的代理中获取此论文:

hf papers read 2609.09113

没有最新CLI? curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型0

没有模型链接到本文

在模型README.md中引用arxiv.org/abs/2609.09113,以将其链接到此页面。

引用本文的数据集0

没有数据集链接到本文

在数据集README.md中引用arxiv.org/abs/2609.09113,以将其链接到此页面。

引用本文的Spaces0

没有Space链接到本文

在Space README.md中引用arxiv.org/abs/2609.09113,以将其链接到此页面。

包含本文的收藏集0

没有收藏集包含本文

将本文添加到收藏集 (https://huggingface.co/new-collection) 以将其链接到此页面。

相似文章

自动化智能体评估的实证研究

arXiv cs.CL

本文介绍了 EvalAgent,这是一个通过编码领域专业知识来自动化 AI 智能体评估的系统,旨在解决标准编程助手在此任务中的局限性。此外,本文还提出了用于测试评估流程的基准 AgentEvalBench,并展示了在评估可靠性方面的显著提升。

跨尺度科学挑战的AI智能体基准测试

arXiv cs.AI

介绍SciAgentArena,一个约200个任务的基准测试,用于评估真实科学研究中的AI智能体。发现智能体在明确指定的数据分析工作流程中表现有效,但在产生新颖见解和开放式探索方面存在困难。