AEGIS —— 在自主AI漏洞发现时代实现集体、分布式且可问责的网络防御框架
摘要
AEGIS 是一个拟议的开放框架,用于构建集体治理、分布式的 AI 网络防御体系,以应对新兴的自主漏洞发现威胁;该威胁由 Anthropic 尚未发布的 Claude Mythos 模型触发,该模型一次性挖掘出大量零日漏洞。
查看缓存全文
缓存时间: 2026/04/22 02:14
chricoho/aegis-cyber-defense-framework
来源:https://github.com/chricoho/aegis-cyber-defense-framework
AEGIS
自主终端守护与情报系统
面向集体、分布式、可问责网络防御的框架
2026 年 4 月,Anthropic 发布 Claude Mythos——一款被认为过于危险而拒绝公开发布的通用 AI 模型。内部测试中,Mythos 在无人类指导的情况下,自主发现了所有主流操作系统和浏览器的零日漏洞,其中包括 OpenBSD 存在 27 年之久的一处缺陷,并构造出可用漏洞利用代码。这些能力并非定向训练所得,而是通用推理与代码能力提升的副产品。
Anthropic 随即启动“Project Glasswing”,将访问权限授予 Microsoft、Google、Apple、Amazon Web Services、JPMorgan Chase 与 Nvidia。名单由 Anthropic 单方面决定,受影响公众无从申诉。
现代网络安全建立在一个前提之上:发现漏洞足够困难,从而天然形成速率限制。该前提可能已失效。一旦崩塌,其上构建的整个大厦不会缓慢削弱,而是彻底瓦解。
本仓库收录一篇工作论文,提出 AEGIS——一个集体治理、架构受限的防御性 AI 系统,可与威胁方保持对等。它不是产品,也不是政府项目,而是一种新型机构的框架,基于三点主张:
- 无论初衷如何,此种能力集中于私人之手在结构上即不稳定
- 核时代的威慑逻辑在此适用,但答案应是分布式防御,而非分布式进攻
- 治理问题必须先于工程问题解决,因为没人会为自己不信任的基础设施投入资源
文档
📄 AEGIS-White-Paper.pdf
工作论文——讨论稿,2026 年 4 月
内容
论文涵盖:
- 问题篇——速率限制前提为何失效、Project Glasswing 暴露的治理缺口,以及传统应对为何不足
- 理论框架——威慑类比及其局限,免疫系统模型作为正确替代
- 技术架构——范围验证、推理引擎、输出限制、分布式部署与透明账本
- 治理结构——理事会构成、决策阈值、问责机制与资金来源
- 安全机制——密码学范围强制、输出限制架构、行为监控、红队评估与能力上限
- 实现路径——三阶段路线图,解决时序难题
- 异议回应——对四条最严重反对意见的回应
状态
此为工作论文,并非最终方案。它旨在引导机构承诺与概念验证开发——作为起点,而非结论。
目标读者正是具备专业知识与资源、能够将其付诸实践的人。
参与
Issue 与 Fork 均已开放。若你想扩展治理框架、提出技术修改,或指出论证中的错误,请在此仓库进行。
如需直接联系,请开 Issue。
相似文章
AEGIS:物理AI的备份反射
AEGIS 使用激活探针早期预警,在长时域机器人操作中故障累积之前切换到更强的策略,恢复的故障次数是预算匹配升级策略的两倍。
Anthropic 发布用于 AI 驱动漏洞发现的开源框架
Anthropic 发布了一个开源参考实现,用于基于 Claude 的自主漏洞发现与修复,涵盖完整流水线(侦察 → 发现 → 验证 → 报告 → 修补),并支持沙箱隔离。该框架配套 Claude Security 托管产品,可用于管理代码库中的漏洞。
通往AGI之路中的安全保护
OpenAI 概述了在通往 AGI 过程中的全面安全措施,包括由 AI 驱动的网络防御、与 SpecterOps 的持续对抗性红队测试,以及为 Operator 等新兴 AI 代理设计的安全框架。该公司强调主动威胁检测、业界合作,以及安全措施与基础设施和模型的深度集成。
AI与网络安全的未来:为何开放性至关重要
Hugging Face 分析了 Anthropic 的 Mythos 模型对网络安全的影响,认为开放式工具和半自主智能体在抵御 AI 驱动威胁方面具有结构性优势。
Claude Mythos 开启网络安全的潘多拉魔盒
Anthropic 发布了 Claude Mythos,这是一款能力极强的 AI 模型,旨在自动发现操作系统、浏览器和软件库中的安全漏洞。出于双重用途风险的考虑,该模型最初仅通过 Project Glasswing 向部分企业和开源合作伙伴开放,此次发布引发了业界关于 AI 安全能力与企业营销策略的广泛争论。