Base Labs 与 Hugging Face 和 Goodfire 推出开放权重 AI 安全合作

TechCrunch AI 新闻

摘要

Base Labs,Baseten 的研究部门,与 Hugging Face 和 Goodfire AI 推出了一项开放权重 AI 安全合作,旨在开发和发布开放模型的安全评估与监控标准,解决诸如 abliteration 等问题。

Base Labs,Baseten 今年早些时候成立的研究小组,将开发和发布用于训练和监控开放模型的方法。
查看原文
查看缓存全文

缓存时间: 2026/09/17 18:10

# Base Labs 联合 Hugging Face 和 Goodfire 启动开放权重AI安全合作项目 | TechCrunch 来源:https://techcrunch.com/2026/09/17/base-labs-launches-an-open-weight-ai-safety-partnership-with-hugging-face-and-goodfire/ Baseten(https://www.baseten.co/)与其旗下研究部门 Base Labs 于周三共同发布了一项新的安全基础设施标准,宣布与 Hugging Face 及 Goodfire AI 建立合作,旨在为开放权重模型构建安全评估与监控基础设施。 此次合作正值业界对开放权重模型安全性产生争议之际——通过一种名为“安全机制清除术”(abliteration)的新兴技术移除模型安全防护后,这些模型可能被恶意利用(相关报道:https://techcrunch.com/2026/09/03/abliteration-ai-is-making-a-business-out-of-removing-ai-guardrails/)。问题规模极为庞大:托管开源AI模型的Hugging Face平台,目前已有超过6,000个经“安全机制清除术”处理的模型。 Base Labs是Baseten今年早些时候成立的研究团队,将负责开发并发布开放模型的训练与监控方法。该公司将未来工作定位为一套“标准”,强调开放性与透明度,并将安全机制深度融入模型训练与部署全流程,而非后期附加。 “我们认为开放性是AI安全的优势所在,”该公司在X平台(https://x.com/baselabs/status/2100286099121705396)发文表示。“开放性使模型行为更透明可见,最重要的是,相比封闭源代码,开放性提供了更多将安全研究转化为可执行、透明化管控措施的途径。” 尽管双方尚未披露合作的具体技术实现方式,但Goodfire在回应Baseten推文时阐明了目标:“安全机制必须内置于开放模型中,并由模型服务方提供保障。”专注于破解AI“黑箱”、解释模型决策机制的Goodfire,最有可能承担“内置安全机制”这部分工作。 作为AI推理服务商,Baseten在今年6月完成了15亿美元F轮融资(报道链接:https://techcrunch.com/2026/06/18/ai-inference-startup-baseten-reportedly-raising-1-5b-months-after-its-last-mega-round/),估值飙升至130亿美元。其合作伙伴Goodfire AI同样资金雄厚,今年早些时候由B Capital领投完成1.5亿美元B轮融资,用于推进其模型可解释性平台发展。 展望未来,Baseten正面向更广泛的开发者生态发起公开邀请,号召各方共同参与框架建设。“我们正携手构建一个安全且全民可及的开放模型生态系统,”该公司强调。 *当您通过文章中的链接购买商品时,我们可能会获得少量佣金(https://techcrunch.com/techcrunch-affiliate-monetization-standards/)。这不会影响我们的编辑独立性。* Russell Brandom 自2012年起持续关注科技行业,聚焦平台政策与新兴技术领域。他曾任职于 The Verge 和 Rest of World,并为 Wired、The Awl 及麻省理工《Technology Review》撰稿。联系邮箱:[email protected],Signal账号:412-401-5489。 查看作者简介(https://techcrunch.com/author/russell-brandom/)

相似文章

OpenAI 和 Anthropic 分享联合安全评估的研究成果

OpenAI Blog

OpenAI 和 Anthropic 发布了首次联合安全评估的研究成果。在这次评估中,两家实验室分别对彼此的模型进行了内部安全和对齐性测试,并公开分享了结果,以提高透明度并发现 AI 安全测试中的潜在漏洞。