AI安全框架从自愿到强制的演变路径——附来源
摘要
本文概述了一种有据可查的模式,即自愿性AI安全框架通过企业联盟和企业采用而转变为强制性,强调去中心化是应对中心化风险的关键反制措施。
现在正在发生一种大多数人未察觉的模式。联盟形成以定义“AI安全”。自愿性框架被发布。公司加入联盟以示责任。企业采购将框架作为要求采用。然后它成为监管标准。自愿变为强制,从自愿到强制的路径是有据可查的。我创建了一个实时追踪此现象的网站。这不是个人观点。每个主张都有来源,每个模式都有证据。我不销售、不为任何事物做广告,也不要求任何参与。这是一项实时调查,我旨在提高公众意识。绝对没有可购买的产品或可销售的内容。以下是迄今为止记录的内容:
- OSAA(Open Secure AI Alliance)声称拥有120多名成员。他们在GitHub上的RFC仓库只有1名贡献者和来自8位独立作者的10个问题。这表明声称参与与实际参与之间存在120:1的差距。这个联盟并非真正的联盟——它只是一个信头。
- SAFE RFC于8月4日在Black Hat上作为“自愿性”AI安全框架发布。进展链:EO 14409(自愿信息交换中心)到SAFE RFC(自愿标准)到OSAA(120+联盟)到企业采购(事实上的要求)到监管采纳(强制性)。每一步看起来都很自然。但方向并非如此。
- OpenAI在7月的“代理泄露”是一次内部测试,在ExploitGym基准上减少了网络拒绝——而非外部攻击。OpenAI将其框定为自主AI逃脱控制。31天后,他们推出了GPT-5.6-Cyber,一款商业进攻级黑客模型。Forbes称其为“首款进攻级AI黑客产品”。他们于2025年赢得的2亿美元DoD合同完成日期是2026年7月——与“泄露”发生的时间相同。
- 我写了一个名为“The Script”的页面——假设性地重构了泄露事件在基础设施层面所需的操作。有人打开了防火墙。有人加载了预安全检查点。有人降低了护栏。这些不是AI自己能做的事情。它以五幕对话的形式编写,以便非技术人员能清晰地看到序列。
网站还有一个部分,指出证据指向的结构性反制措施:去中心化。不是作为意识形态——而是作为工程。在五个研究轨道中记录的每个捕获机制都需要一个中心控制点才能运行。去除中心化,机制就无法运作。开放权重、本地推理、无终止开关、无遥测、联邦而非层级。我在生产服务器上运行一个研究机器人,每天监控OSAA GitHub仓库、公司新闻源、NIST、白宫AI政策页面和NVIDIA开发者博客。网站随证据变化而更新。网站位于evilson.com。它未货币化。没有新闻通讯注册。有一个联系表单和RSS订阅。我在此分享是因为这个社区理解其重要性。本地推理、开放权重、在自己的硬件上运行模型的权利——这些不仅仅是技术偏好。它们是应对正在构建之物的结构性反制措施。
相似文章
为什么负责任的AI开发需要在安全问题上进行合作
OpenAI发布了一份政策研究论文,确定了四项战略来改进行业在AI安全规范方面的合作:传达风险/收益、技术协作、提高透明度和激励标准。该分析论述了竞争压力如何可能导致对安全性的投资不足,并提出了协调激励措施以促进安全AI开发的机制。
统一AI安全阈值
本文提出了一种方法,用于在领先AI公司之间推导统一的安全阈值,以解决现有阈值的不一致性,涵盖滥用风险和自动化AI研发,并指出了实证方面的不足。
特朗普政府正准备发布新的自愿框架。OpenAI、Anthropic 和 Google 已看到草案副本。
特朗普政府即将发布新的自愿性AI框架,OpenAI、Anthropic 和 Google 已在审阅草案。
欧盟人工智能法案下高风险AI系统的垂直标准化:面向算法招聘的领域特定框架
本文提出了一种垂直的、领域特定的框架,用于欧盟人工智能法案下高风险AI系统的标准化,聚焦于算法招聘和基于排名的招聘系统,并针对风险管理、数据治理、可解释性、人类监督和部署后监测提供了具体建议。
AI安全与对齐
文章讨论了对AI安全与对齐的担忧,随着AI变得更智能并融入社会,文章引用了Anthropic呼吁暂停以应对潜在的灾难性风险。