@baselabs: 我们相信开放性对于人工智能安全是一个优势。开放性为模型行为提供了更多可见性,并且……
摘要
Baseten和Base Labs正在为开放模型推出安全基础设施,通过透明度和与Hugging Face以及Goodfire AI的合作来改善人工智能安全。
查看缓存全文
缓存时间: 2026/09/17 04:11
我们坚信开放性是人工智能安全的一大优势。开放性不仅能让模型行为更加透明可见,更重要的是,相比闭源系统,它能为安全研究成果转化为可执行、可审计的控制手段提供更有力的途径。
正因如此,Baseten与Base Labs正携手构建更完善的开源模型安全标准,今天我们正式推出安全基础设施。Base Labs将开发并公开开源模型的训练与监控方法,Baseten则会将这些研究成果整合到部署基础设施中,在运行时实现实时保障,并将其作为托管服务提供。这套标准将保持全程透明,并深度融入我们模型的训练与部署全流程。
我们诚邀开源社区共同参与,并很高兴能与@huggingface和@GoodfireAI携手实现这一愿景。
让我们共同构建安全开放、惠及所有人的开源模型生态。
相似文章
Base Labs 与 Hugging Face 和 Goodfire 推出开放权重 AI 安全合作
Base Labs,Baseten 的研究部门,与 Hugging Face 和 Goodfire AI 推出了一项开放权重 AI 安全合作,旨在开发和发布开放模型的安全评估与监控标准,解决诸如 abliteration 等问题。
@LRudL_: 我认为完全有可能在开发既开放又安全的模型方面取得重大进展!前者将变得更加……
一条推文讨论了推进既开放又安全的AI模型的潜力,强调了开源对于防止中心化和确保安全的重要性,因为当前存在挑战。
OpenAI 安全实践
OpenAI 介绍了其积极采用并不断改进的 10 项安全实践,包括实证红队测试、对齐研究、滥用监控以及在首尔 AI 峰会上分享的自愿承诺。该公司强调采用均衡、科学的安全方法,将其融入开发的各个环节。
OpenAI 和 Anthropic 分享联合安全评估的研究成果
OpenAI 和 Anthropic 发布了首次联合安全评估的研究成果。在这次评估中,两家实验室分别对彼此的模型进行了内部安全和对齐性测试,并公开分享了结果,以提高透明度并发现 AI 安全测试中的潜在漏洞。
@MTSlive:我们询问了HuggingFace首席执行官@ClementDelangue关于发布强大开源模型的风险。他表示…
HuggingFace首席执行官Clément Delangue认为,限制开源AI模型带来的风险比开放更大。他以GPT-2和Mythos等历史例子为例,支持他的观点:开放能改善网络安全和整体安全性。