Anthropic 表示其人工智能现在完成了四分之一的研究工作(25 分钟阅读)

TLDR AI 新闻

摘要

Anthropic 引入了测量工具来追踪人工智能发展的步伐,包括人工智能自动化其自身研究的程度,并计划实施第三方监督以提高安全性和透明度。

Anthropic 表示,Claude 现在主导了其26%的人工智能研究工作,并监督着数万个活跃的内部代理。其新的测量工具追踪人工智能在构建下一代模型中的参与程度、人们是否仍能监督这些代理,以及推动工作的计算资源。
查看原文
查看缓存全文

缓存时间: 2026/09/18 14:30

# 理解前沿实验室AI发展速度的度量标准 来源:https://www.anthropic.com/institute/measuring-pace-of-ai-development 人工智能系统正以指数级增长的能力,开始自动化更多(https://www.anthropic.com/institute/recursive-self-improvement)构建自身的过程。随着全球考虑放慢前沿AI的发展速度(https://darioamodei.com/post/we-must-pace-the-frontier),公众需要更多信息。 本文中,我们列出了可以揭示AI发展三个关键方面的度量工具: 1. AI在构建下一代自身版本中所起的作用程度,而非完全由人类构建(https://www.anthropic.com/institute/measuring-pace-of-ai-development#1-measuring-ai-led-ai-rd) 2. 我们监督和干预AI代理在Anthropic系统上采取行动的能力(https://www.anthropic.com/institute/measuring-pace-of-ai-development#2-measuring-oversight-of-ai-agents) 3. 驱动更强大模型开发的资源(https://www.anthropic.com/institute/measuring-pace-of-ai-development#3-measuring-compute-allocation) 我们还提供了Anthropic内部的这些指标快照。需要指出的是,如果按照Anthropic首席执行官Dario Amodei所呼吁的那样,在放慢前沿发展速度方面进行协调,我们预计这些数字会发生变化。我们计划在Anthropic引入来自多个组织的独立第三方评估员,并给予他们与内部风险评估团队相当的内部流程、系统和数据访问权限。这些第三方将核实安全实践、报告事件并监测如本文中的关键指标。 我们报告这些度量标准,是因为它们能让公众、第三方和政府更清晰地了解前沿实验室内部AI发展的速度。对于每项度量,我们描述了度量内容、度量结果,以及定期以可验证形式发布这些度量所需具备的条件。具体方法论细节见附录。 ## 追踪这些度量的原因 本文中的度量标准专注于*模型的构建方式*。通过更好地理解模型的生产过程,我们更有可能将模型输入(如算力)与模型输出(如能力)联系起来。它们补充了能力评估,后者衡量*模型能做什么*。我们通过《负责任扩展政策》(https://www.anthropic.com/responsible-scaling-policy)(RSP)风险报告单独发布这些评估,其中包含了关于我们的模型在多大程度上加速了AI研发的证据。在我们的先进AI政策提案——《先进AI框架》(AAIF)(https://www-cdn.anthropic.com/files/4zrzovbb/website/0a58d567024a8b448ff15158ebc3625328dfcc1f.pdf)中,我们提出了任何实验室发布安全模型的指导原则,包括政府可能要求的透明度义务,如风险报告。总之,这些拟议的度量和政策是从外部监控AI发展速度的起点。 ## (1)衡量AI主导的AI研发 **为何衡量AI主导的研发?**前沿AI实验室越来越多地使用AI来构建未来的AI模型。这一过程允许民主国家的实验室更快地开发更强大的模型,并在模型发布前进行更多安全和测试,以在保持前沿的同时确保AI带来的益处。然而,模型加速自身发展可能会使人类更难理解或控制这些系统。因此,分享这些指标对于理解世界距离达到递归自我改进(https://www.anthropic.com/institute/recursive-self-improvement)(即模型完全自主地构建其后继模型)还有多远非常重要。 **我们衡量了什么。**我们构建了一个原型指数,用于衡量Anthropic的AI研发中有多少工作由Claude完成,称为Anthropic研发自动化指数。该指数的构建方法是:列出公司内部进行的所有AI研发工作类型,评估每项任务当前的自动化程度,然后将这些评级进行汇总。 **我们的发现。**为了衡量AI在Anthropic从事AI研发的程度,我们使用了Epoch AI开发的自动化评级量表(https://epochai.substack.com/p/toward-an-onet-for-ai-r-and-d),该量表衡量“自动化级别”或AL。范围从AL0(无AI参与)到AL5(AI完全自主运行,无人参与)。在AL3中,AI进行“协作”:它可以在人类密切指导下完成大部分工作。在AL4中,AI“主导”:它能从高级提示端到端完成大部分任务,同时由人类进行监督1 (https://www.anthropic.com/institute/measuring-pace-of-ai-development#footnote-1)。 截至2026年8月, - Claude在任何衡量的AI研发工作子集中均未完全自主运行。 - Claude“主导”了Anthropic 26%的AI研发工作。 - 处于或高于“AI协作”水平的工作占比超过90%。 图表显示Claude现在主导了Anthropic 26%的模型研发任务,高于2026年2月的不到1%。 **任何AI开发者今天可以报告的内容。**任何前沿开发者都可以使用公开的方法论定期发布这些指标。这将使数字能够随时间进行比较,并可能实现跨实验室的比较。 此类报告的跨实验室比较面临两个障碍。首先是缺乏通用方法论。其次,我们使用自己的模型来评估我们的系统,这意味着“评判”模型可能会犯与其正在检查的模型相同类型的错误。为了解决这些挑战,开发者的测量结果可以由第三方或其他开发者的模型进行验证,并设置护栏以限制竞争敏感数据的交换。这些措施也可能成为更强要求的触发因素,例如在将新模型用于进一步AI研发之前设置固定的测试窗口期。 ## (2)衡量AI代理的监督 **为何衡量代理监督?**与其他前沿开发者一样,Anthropic的员工越来越多地将任务委托给半自主运行较长时间的代理,这些代理又将工作相互委托。随着工作从“AI协作”向“AI主导”过渡,自动化程度越来越高,代理可能会做出更具影响力的决策,例如接下来追求哪个研究方向。 这些决策需要保障措施来阻止单个代理的有害行为,还需要监督机制来检测可能仅在多个代理中出现的问题。迄今为止的监测数据显示,单个代理很少出现违规行为。但当经济中有数百万或数十亿个代理运行时,即使罕见的事件也可能经常发生。 **我们衡量了什么。**我们构建了一个系统,让我们能够监督和干预AI代理在Anthropic系统上采取的行动。这里,我们考虑了三个不同的指标:*覆盖率*,描述代理行动中有多大比例在执行前或执行后经过监控器;*审查延迟*,指行动与审查之间的时间,先是自动监控器,然后是人类;以及*升级率*,指被阻止/重定向(在线监控器情况)或标记待进一步审查(离线监控器情况)的代理活动比例。 **我们的发现。**截至2026年8月,在我们最常用的内部平台上,任何时候大约有30,000名代理在从事研究和工程工作。这些指标仅涵盖该平台。这些代理的行动受两类监控器的约束,总结如下: **在线监控器** | **离线监控器** | **描述** --- | --- | --- 在线监控器*实时*检查代理的行动,并自动阻止危险行为或引导代理的不当行为。它们旨在解决可能迅速发生且无法挽回的伤害,例如代理复制模型权重离开我们的系统。 | 离线监控器在事后阅读代理活动。它们旨在帮助解决缓慢发展且可逆转的危险行为,如模型失调迹象。我们使用标记的活动来改进缓解措施,如分类器和确定性控制。如果情况造成重大即时危险,我们将关闭代理部署的危险部分。 **覆盖率** | 100%的这些代理行动在执行前都会经过在线监控器,通常在几秒钟内。 | 100%的这些代理行动在执行后都会被监控器接收。 **审查延迟** | 自动审查在代理采取行动前进行;人类在一周内审查任何被阻止的行动。 | 监控器每周标记约100,000份记录,然后由多个分类器进行误报和初步监督审查。大多数标记在此过程中得到解决,最高优先级的标记(每周约50个)升级给人类审查。 **阻止/升级率** | 我们分析了2026年8月研究与工程代理做出的超过十亿项决策,发现其中0.002%(约每47,000个中有1个)被此监控器阻止。 | 监控器标记约每一千份记录中的一到两份以供进一步审查。 **任何AI开发者今天可以报告的内容。**任何在其自身研究和工程工作负载上运行代理的开发者都可以发布相同的指标:*覆盖率*(被监控的代理活动比例)、*审查延迟*(被标记活动的审查速度)以及*升级率*(监控器阻止或标记的代理活动比例)。这些指标共同使社会能够看到监督是否跟上了AI在AI研发中日益增长的作用。我们在最近的《风险报告》(https://www.anthropic.com/aug-2026-risk-report)中发布了所有这些度量。 开发者应分享已知的代理不当行为被监控器捕获的频率,并应让第三方独立进行此类测试。过去,METR已独立对我们的离线监控平台进行了红队测试(https://www-cdn.anthropic.com/f61d49fa5596956a5dec75fea0e973bf6a6a8378/Redacted%20Risk%20Report%20August%202026%20.pdf)。如上所述,我们目前正在Anthropic设立外部第三方评估员(https://darioamodei.com/post/we-must-pace-the-frontier)。 ## (3)衡量算力分配 **为何衡量算力分配?**广义上讲,AI开发者使用算力来构建更强大的模型、服务客户以及开展安全相关工作,例如审计模型的“思维”(https://www.anthropic.com/research/natural-language-autoencoders)、训练模型生物体以研究失调(https://www.anthropic.com/research/emergent-misalignment-reward-hacking),以及评估模型是否可以安全部署(https://www-cdn.anthropic.com/f61d49fa5596956a5dec75fea0e973bf6a6a8378/Redacted%20Risk%20Report%20August%202026%20.pdf)。了解AI开发者如何分配其算力,可以告诉你开发者的资源集中在哪里,以及这种重点如何随时间变化。 此外,算力是AI研发过程中最可验证的输入之一,这意味着它可能成为未来发展速度协调的关键杠杆。协调的发展速度协调工作可以鼓励公司增加整个行业分配给安全的算力,并投入更多资源用于对齐、可解释性、安全测试和评估。 **我们衡量了什么。**我们考察了2026年7月13日至7月20日期间(https://www.anthropic.com/institute/measuring-pace-of-ai-development#footnote-2)Anthropic如何使用其所有算力的快照。为此,我们将每个工作负载分为少数几类,然后计算用于AI研发的算力中有多少是用于安全工作。 从本质上讲,安全研究往往比前沿训练运行使用更少的算力,因此算力是衡量公司安全关注程度的一个不完美代理。这是因为安全研究包括个别研究人员设计实验,即使运行实验并不特别消耗算力,这一过程也很耗时。因此,该指标的价值不在于绝对数字,而在于它提供了一种直接的机制,可以在开发者之间和时间跨度上进行同类比较。 **我们的发现。**在考察的一周内,大约6%用于AI研发的算力被分配给安全工作,大约12%用于AI驱动的AI研发的算力被分配给安全工作。 这些是刻意保守的估计。例如,如果一个token在推进能力和推进安全方面使用程度相同,则不计入这些指标。此外,这些指标不包括安全护栏分类器,它们是单独的、相当数量的算力,使我们的模型对世界更安全。 **任何AI开发者今天可以报告的内容。**任何前沿开发者都可以发布其AI研发算力中有多少用于安全工作的比例,同时发布类别定义,并由独立第三方检查分类。 安全研究与能力研究难以区分,每个开发者都可能倾向于宽松地划定界限。举证责任应由开发者来证明工作与安全相关。开发者、政府和更广泛的研究界将受益于提前就共享定义达成一致。像这样的度量可以为未来的行动提供信息,例如实验室对安全研究算力比例的承诺,或对用于AI研究代理的算力比例的限制。 ## 结论 随着世界考虑放慢前沿发展速度,我们应尽一切努力缩小前沿实验室所知与公众所知之间的差距。这意味着更好地度量AI的发展、公开报告,并让社会有机会决定如何使用这些信息。我们希望通过发布这些度量来示范这种透明度,并将继续这样做。 ## 附录 以下是我们已原型化的所有度量的方法论细节。 ### 衡量AI主导的研发 **我们如何做的。**自动化指数需要三件事:一份Anthropic所有AI研发任务的完整地图、一种评估自动化水平的方法,以及一种对任务进行加权的方法,以便重要工作领域比不太重要的工作计入更多。没有一个人能手动列出前沿AI公司的每一项AI研发任务,至少无法达到我们想要的精细程度。相反,我们以自下而上的方式从工作记录(包括Slack和各种内部文档)构建了这份任务列表。 对于2026年7月的每一周,我们从构成模型研发循环的每个部门随机抽取20%的员工。一个Claude研究代理使用Slack和内部文档审查每位抽样人员的周工作,并列出他们完成的任务。重复此过程2026年7月的每一周,为我们提供了一份约15,000项精细模型研发任务的扁平列表。然后我们使用Claude将这些任务组织成层次树,从根节点的所有模型研发开始,分支到训练和产品等领域,然后是预训练和强化学习等,直到越来越具体的工作类型。最终形成的树有542个不同深度的节点,其中378个是叶子节点,如“评估平台缺陷诊断与修复”、“RL沙箱出口和网络策略”以及“服务事件事后分析”。我们冻结此树,以便每次度量都针对相同的工作组合进行。 对于树中的每个节点(描述其下所有工作的一个任务类别),一个Claude代理深入研究……

相似文章

OpenAI:AI 智能体目前每 1 个人类研究员工作日可完成 3.1 个研究员工作日的工作量,称其已达到“自动化研究实习生”水平,并预计 2028 年 3 月实现“自动化 AI 研究员”

Reddit r/singularity

OpenAI 声称,其 AI 智能体现在每 1 个人类研究员工作日可贡献 3.1 个工作日,已达到“自动化研究实习生”水平,并预计 2028 年 3 月实现“自动化 AI 研究员”。该公司表示,智能体系统加速了递归自我改进的进程,使其研究团队规模从约 1000 人有效扩充至相当于 4000 人以上。

Anthropic

Reddit r/singularity

Anthropic,这家专注于AI安全与研究的公司,近日成为新闻焦点。