@AnthropicAI:AI系统变得越来越强大,并且越来越多地被用于构建自身的下一代版本。我们希…
摘要
Anthropic分享三个关键指标来跟踪AI发展进展,包括AI主导的研发、代理监督和计算资源分配,以增强公共透明度。
查看缓存全文
缓存时间: 2026/09/17 21:35
AI系统正变得日益强大,且越来越多地被用于构建自身的下一代版本。我们希望向公众阐明这一进程。
今天,我们分享三项用于追踪AI发展的指标:
- AI承担了多少比例的研发工作
- AI智能体受到何种程度的监督
- 计算资源如何分配
我们从Anthropic内部提供了这些指标的快照。任何前沿开发者都可发布同类指标,第三方机构能够对此进行验证。
当世界考虑管控前沿发展步伐时,我们应尽力缩小前沿实验室与公众之间的信息差距。这意味着需要更精准地衡量AI发展、公开研究成果,并让社会有机会决定如何运用这些信息。
阅读完整文章与方法论说明:
衡量前沿实验室AI发展速度的标准
来源:https://www.anthropic.com/institute/measuring-pace-of-ai-development AI系统的实力正呈指数级增长,并已开始自动化更多(https://www.anthropic.com/institute/recursive-self-improvement)构建自身的过程。当世界考虑放缓(https://darioamodei.com/post/we-must-pace-the-frontier)前沿AI发展步伐时,公众需要更多信息。
本文中,我们提出可阐明AI发展三大关键维度的测量工具:
- AI在构建下一代自身模型中所承担的工作比重(区别于人类构建)(https://www.anthropic.com/institute/measuring-pace-of-ai-development#1-measuring-ai-led-ai-rd)
- 我们监督与干预Anthropic系统内AI智能体行为的能力(https://www.anthropic.com/institute/measuring-pace-of-ai-development#2-measuring-oversight-of-ai-agents)
- 驱动更强大模型发展的计算资源(https://www.anthropic.com/institute/measuring-pace-of-ai-development#3-measuring-compute-allocation)
我们同时提供了Anthropic内部的这些指标快照。需要说明的是,若如Anthropic首席执行官达里奥·阿莫迪所倡导的那样开展前沿发展协调管控,我们预期这些数据将发生变化。我们计划在Anthropic引入来自多个组织的独立第三方评估机构,使其获得与内部风险评估团队相当的内部流程、系统和数据访问权限。这些第三方将验证安全实践、报告事件,并监测如本文所述的关键指标。
我们公开这些测量结果,是因为它们能为公众、第三方和政府提供更透明的视角,了解前沿实验室内部的AI发展速度。针对每项指标,我们说明了测量内容、测量结果,以及定期公开可验证测量数据所需条件。方法论细节详见附录。
追踪这些指标的原因
本文的指标聚焦于模型构建方式。通过深入理解模型的生产过程,我们更有机会建立计算资源等模型输入与能力等模型输出之间的关联。它们与能力评估(衡量模型能做什么)形成互补。我们通过负责任扩展政策(RSP)(https://www.anthropic.com/responsible-scaling-policy)单独发布能力评估报告,其中包含关于模型加速AI研发程度的证据。在先进AI框架(AAIF)(https://www-cdn.anthropic.com/files/4zrzovbb/website/0a58d567024a8b448ff15158ebc3625328dfcc1f.pdf)政策提案中,我们为任何实验室安全发布模型制定了规则,包括政府可要求的透明度义务(如风险报告)。这些拟议的指标与政策共同构成了从实验室外部监测AI发展速度的起点。
(1)衡量AI主导的研发活动
**为何要衡量AI主导的研发?**前沿AI实验室正越来越多地利用AI构建未来模型。这一进程使民主国家实验室能更快速地开发更强大的模型,并在发布前进行更多安全测试,从而在保持前沿地位的同时确保AI福祉。然而,模型加速自身发展的过程可能使人类更难理解或控制这些系统。因此,公开这些指标至关重要,以便了解世界距离(https://www.anthropic.com/institute/recursive-self-improvement)递归式自我改进(模型完全自主构建下一代)还有多远。
**测量内容。**我们构建了衡量Anthropic AI研发工作中Claude参与度的原型指标——Anthropic研发自动化指数。该指数通过分类公司所有AI研发任务、评估每项任务当前的自动化程度,并进行汇总得出。
**研究结果。**为量化Anthropic内部AI承担研发工作的程度,我们采用Epoch AI开发的(https://epochai.substack.com/p/toward-an-onet-for-ai-r-and-d)自动化评级量表(AL等级)。等级从AL0(无AI参与)到AL5(AI完全自主运行,无人类在环)。在AL3等级中,AI“协作“:可在人类密切指导下完成大部分工作。在AL4等级中,AI“主导“:能从高级指令开始端到端完成大部分任务,人类仅需监督(https://www.anthropic.com/institute/measuring-pace-of-ai-development#footnote-1)。
截至2026年8月:
- 尚无任何AI研发工作子集实现Claude完全自主运行。
- Claude“主导“了Anthropic 26%的AI研发工作。
- 达到或超过“AI协作“等级的工作占比超过90%。
图表显示Claude现已主导Anthropic 26%的模型研发任务,较2026年2月的不足1%大幅提升。 **当前任何AI开发者可公开的指标。**任何前沿开发者都可定期发布这些指标,采用公开方法论。这将实现指标的跨时间、跨实验室对比。
跨实验室对比此类报告存在两个障碍:一是缺乏统一方法论;二是我们使用自有模型评估系统,这意味着“裁判“模型可能产生与被检模型相似的错误。为解决这些挑战,开发者测量结果可由第三方或其他开发者的模型验证,同时设置防护机制以限制竞争敏感数据的交换。这些指标也可成为强化要求的触发器,例如规定新模型用于进一步AI研发前的固定测试窗口。
(2)衡量AI智能体监督能力
**为何要衡量智能体监督?**与其他前沿开发者相同,Anthropic员工越来越多地将任务委派给能长时间半自主工作并相互协作的智能体。随着工作从“AI协作“向“AI主导“过渡,智能体可能做出更具影响力的决策(如选择下一步研究方向)。
这些决策需要防护机制以阻止单个智能体的有害行为,也需要监督机制来发现可能仅在大量智能体中出现的问题。根据目前监测数据,单个智能体极少出现异常。但当经济体系中运行着数百万乃至数十亿智能体时,即使罕见事件也会定期发生。
**测量内容。**我们构建了可监督并干预Anthropic系统中AI智能体行为的系统。此处考虑三项指标:覆盖率(智能体行为在执行前后通过监控的比例)、审查延迟(行为发生到自动监控及人工审查的时间差)以及升级率(被阻止/重定向或标记进一步审查的智能体活动比例)。
**研究结果。**截至2026年8月,Anthropic最常用的内部平台上任何时刻都有约30,000个智能体在进行研究与工程工作。本指标仅涵盖该平台。这些智能体的行为受两类监控器约束:
在线监控器离线监控器说明在线监控器实时检查智能体行为,自动阻止危险行为或引导异常行为。旨在防范快速发生且不可逆的危害(如智能体复制模型权重)。离线监控器事后分析智能体活动。旨在帮助处理逐渐发展且可逆的危险行为(如模型失谐迹象)。我们利用标记活动改进缓解措施(如分类器和确定性控制)。若存在重大紧迫威胁,我们将终止智能体危险部署部分。覆盖率100%的行为在执行前通过在线监控器,通常数秒内完成。100%的行为在发生后被监控器记录。审查延迟自动审查在智能体行动前完成;所有被阻行为在一周内接受人工审查。监控器每周标记约10万条记录,经多分类器检查误报和初步监督审查。大部分标记在此流程中解决,最高优先级标记(约每周50条)升级至人工审查。阻止/升级率我们分析了2026年8月研究与工程智能体的超十亿项决策,发现0.002%(约四万七千分之一)被该监控器阻止。监控器标记约千分之一至二的记录供进一步审查。 **当前任何AI开发者可公开的指标。**任何在其研究与工程工作中运行智能体的开发者都可发布相同指标:覆盖率(受监控的智能体活动比例)、审查延迟(标记活动的审查及时性)以及升级率(监控器阻止或标记的活动比例)。这些指标共同让社会能看到监督能力是否跟得上AI在研发中日益重要的角色。我们在最近的风险报告(https://www.anthropic.com/aug-2026-risk-report)中公开了所有这些指标。
开发者应公布监控器捕获已知智能体异常行为的频率,并由第三方独立进行此类测试。此前,METR已(https://www-cdn.anthropic.com/f61d49fa5596956a5dec75fea0e973bf6a6a8378/Redacted%20Risk%20Report%20August%202026%20.pdf)独立对我们的离线监控平台进行红队测试。如上所述,我们现正(https://darioamodei.com/post/we-must-pace-the-frontier)在Anthropic建立外部第三方评估机制。
(3)衡量计算资源分配
**为何要衡量计算资源分配?**广义上,AI开发者使用算力构建更强大的模型、服务客户,以及开展安全工作(如(https://www.anthropic.com/research/natural-language-autoencoders)审计模型“思维“、(https://www.anthropic.com/research/emergent-misalignment-reward-hacking)训练研究失谐的模型生物、(https://www-cdn.anthropic.com/f61d49fa5596956a5dec75fea0e973bf6a6a8378/Redacted%20Risk%20Report%20August%202026%20.pdf)评估模型能否安全部署)。理解AI开发者如何分配算力,可揭示其资源聚焦方向及变化趋势。
此外,算力是AI研发过程中最可验证的投入之一,意味着它可能是未来管控工作的关键杠杆。协调管控工作可鼓励企业增加全行业安全研究算力投入,为对齐、可解释性、安全测试与评估分配更多资源。
**测量内容。**我们分析了2026年7月13日至20日(https://www.anthropic.com/institute/measuring-pace-of-ai-development#footnote-2)Anthropic全部算力使用的快照。为此,我们将所有工作负载分为少数几类,然后计算用于AI研发的算力中有多少比例投入安全工作。
安全研究本质上比前沿训练需要更少算力,因此算力是衡量企业安全投入的不完美代理指标。这是因为安全研究包含单个研究员设计实验的过程,尽管实验运行本身算力需求不高,但设计过程耗时。因此,该指标的价值不在于绝对数字,而在于提供可跨开发者、跨时间进行同类比较的直接机制。
**研究结果。**在考察周内,用于AI研发的算力中约6%投入安全研究,用于AI主导研发的算力中约12%投入安全研究。
这些是刻意保守的估算。例如,若某令牌同时用于提升能力与安全改进,则不计入这些指标。此外,这些指标未计入安全防护分类器的算力(其算力投入相当,使模型对世界更安全)。
**当前任何AI开发者可公开的指标。**任何前沿开发者都可公开其AI研发算力中用于安全研究的比例,并发布类别定义,由独立第三方核查分类。
安全研究与能力研究难以区分,每个开发者都可能倾向于宽松界定。举证责任应在于开发者证明工作与安全相关。开发者、政府和更广泛的研究界将受益于事先就共享定义达成一致。此类指标可为未来行动提供信息,例如实验室承诺安全研究算力比例,或限制用于AI研究智能体的算力比例。
结论
当世界考虑管控前沿发展时,我们应尽力缩小前沿实验室与公众的信息差距。这意味着需要更精准地衡量AI发展、公开报告研究成果,并让社会有机会决定如何运用这些信息。我们希望通过公开这些指标来示范透明度原则,并将持续这样做。
附录
以下是所有原型测量指标的方法论细节。
衡量AI主导的研发活动
**实施方法。**自动化指数需要三要素:Anthropic所有AI研发任务的完整图谱、自动化程度评级方法,以及任务权重机制(使重要领域的工作权重更高)。没有任何人能手工列出前沿AI公司的所有AI研发任务(至少达不到所需精度)。我们从Slack记录和各类内部文档等工作中自下而上构建了任务清单。
2026年7月的每一周,我们从参与模型研发的每个部门随机抽取20%员工。Claude研究智能体利用Slack和内
相似文章
Anthropic 表示其人工智能现在完成了四分之一的研究工作(25 分钟阅读)
Anthropic 引入了测量工具来追踪人工智能发展的步伐,包括人工智能自动化其自身研究的程度,并计划实施第三方监督以提高安全性和透明度。
关于人工智能最重要数字的最新进展(8分钟阅读)
本文更新了OpenAI和Anthropic前所未有的收入增长,强调了它们创纪录的年增长率,并对人工智能行业如此快速扩张的可持续性提出质疑。
@AnthropicAI: 仅靠这些项目本身不足以应对先进AI的挑战。但它们表明了我们的……
Anthropic表示将在未来几个月和几年内扩大应对先进AI挑战的项目。
@AnthropicAI:人工智能的发展速度远超我们政策制定机构的设计能力——两者之间的差距正在成为这项技术的核心挑战。
Anthropic CEO Dario Amodei 发表文章《Policy on the AI Exponential》,并宣布三项新举措,以应对人工智能快速发展与政策制定之间的差距。
AI 新闻:Anthropic 泄露揭示 AI 未来
泄露的 Claude Code 仓库曝光 Anthropic 的自主“恶魔模式”智能体与三层记忆系统,同时 OpenAI 完成创纪录的 1220 亿美元融资,微软发布 MAI-Transcribe-1。