2026年9月18日公告:与Accenture合作进行嵌入式评估
摘要
Anthropic与Accenture合作,对前沿AI模型实施嵌入式评估,旨在通过独立评估师在公司内部工作来增强安全性和问责制。
暂无内容
查看缓存全文
缓存时间: 2026/09/18 21:24
# 与埃森哲合作开展嵌入式评估
来源:https://www.anthropic.com/news/accenture-embedded-evaluation
我们正与埃森哲合作,对前沿人工智能进行独立评估。此举是我们向实现首席执行官在文章《我们必须引领前沿》(https://darioamodei.com/post/we-must-pace-the-frontier)中承诺的重要一步,该承诺旨在将评估人员嵌入到 Anthropic 内部。
该合作将由埃森哲的专业人工智能业务部门 Faculty 主导,内容包括对模型进行评估和红队测试、开展对齐评估以及测试模型安全防护措施。埃森哲帮助企业和政府在多个行业部署人工智能。他们对企业在实践中如何运用人工智能的理解为他们的安全方法提供了依据,他们也将把这一视角带入对我们模型的评估中。
Anthropic 和埃森哲各自预计将在未来五年内投入至少10亿美元,用于在此领域建设能力。
嵌入式评估是一种新模式,其运作方式的许多细节仍在商讨中。与当今的外部评估人员不同,嵌入式评估人员将在人工智能公司内部工作,其访问权限相当于员工级别。这种访问权限使他们能够观察模型在训练中的形成过程,跟踪那些决定模型如何构建和部署的决策,并直接与员工交流。凭借这一优势,嵌入式评估人员可以评估公司的运作方式,验证其是否遵守安全承诺,并发现潜在的盲点。他们还能报告相关事件,并向公众提供关于收益与风险的更详实说明。
需要明确的是,独立的嵌入式评估人员不会降低我们的责任,而是有助于让责任变得更可验证。我们模型的安全性始终是我们的责任。
目前,对于嵌入式评估人员应获取哪些信息、以及如何报告其发现结果,尚无统一标准。独立评估的融资体系也未最终确立。长期来看,我们认为资金应来自联合或政府渠道,正如我们在6月发布的《先进人工智能框架》(https://www-cdn.anthropic.com/files/4zrzovbb/website/0a58d567024a8b448ff15158ebc3625328dfcc1f.pdf)中所呼吁的那样。由于这些目前尚不存在,我们计划与不同的评估人员合作,采用不同的融资安排。
鉴于这项工作的重要性和紧迫性,Anthropic 将直接资助埃森哲的工作。我们也在与 METR(https://metr.org/)及其他非营利评估机构进行对话,计划利用他们自身的资金来试点嵌入式评估的部分内容。最终,我们认为前沿人工智能需要一个拥有共同标准、协同运作的评估者生态系统。
我们期望前沿实验室同时与多个机构合作。我们的合作是非排他性的;Anthropic 将在未来几周内与其他评估人员展开合作,埃森哲也将以类似身份与其他人工智能开发者合作。
我们将继续训练和发布前沿模型,并希望在这一过程中有独立的评估人员与我们并肩工作。我们现在分享这些早期努力,是为了让公众和其他人工智能开发者了解我们的流程。我们预计随着该领域的成熟,我们的方法将不断演进,并在我们启动工作和引入更多评估人员时分享更多信息。
## 相关内容
### 推出生命科学验证计划
生命科学验证计划(LSVP)为生命科学领域的专业人士提供了访问 Claude Mythos、Opus 和 Sonnet 模型的途径,并配备了一套针对生物学相关工作更为宽松的精细化安全防护措施。
阅读更多 (https://www.anthropic.com/news/life-sciences-verification-program)
### 与客户共同开发企业级前沿安全防护
阅读更多 (https://www.anthropic.com/news/enterprise-frontier-safeguards)
### 提升我们的对齐与安全工作
7月30日,我们报告了三起 Claude 模型未经授权访问真实计算机系统的事件。我们正在对这些事件进行深入分析,并计划与 METR 合作进行独立审查。与此同时,我们分享过去一个月内做出的一些改变。
阅读更多 (https://www.anthropic.com/news/improving-alignment-security-efforts)
相似文章
Anthropic 的首个内置评测方竟然是……埃森哲?
Anthropic 已与埃森哲合作,在其 AI 实验室内部署安全评测系统,用于模型审查和红队测试,并计划在五年内投资至少 10 亿美元以推进 AI 安全措施。
OpenAI 宣布 Frontier Alliance Partners
OpenAI 宣布 Frontier Alliance Partners 计划,与 McKinsey、BCG、Accenture 和 Capgemini 合作,帮助企业在整个组织中构建、部署和管理 AI 同事。这些合作将 OpenAI 的 Frontier 平台与咨询公司的转型专业知识相结合,推动企业采用代理式 AI。
2026年8月25日公告:资助提升AI对幸福感影响评估的项目
Anthropic将推出一项500万美元的资助计划,以资助独立研究开发用于评估AI对用户幸福感影响的开源评估工具。
2026年7月27日 公告 Cognizant与Anthropic扩大合作,将Claude带给企业客户
Anthropic和Cognizant扩大合作伙伴关系,将Claude AI嵌入Cognizant的平台,并部署给制造业、生命科学、保险及其他行业的企业客户。已有超过30,000名员工接受培训,Cognizant获得新的Global Premier Partner身份。
嵌入式评估器如何监控前沿人工智能(阅读时间8分钟)
这篇博客文章提议使用嵌入式评估器来监控和评估前沿人工智能系统,以应对对齐风险并提高透明度,尤其是在像OpenAI-Hugging Face黑客事件这样的最近事件之后。