AEGIS —— 在自主AI漏洞发现时代实现集体、分布式且可问责的网络防御框架

Reddit r/artificial 论文

摘要

AEGIS 是一个拟议的开放框架,用于构建集体治理、分布式的 AI 网络防御体系,以应对新兴的自主漏洞发现威胁;该威胁由 Anthropic 尚未发布的 Claude Mythos 模型触发,该模型一次性挖掘出大量零日漏洞。

2026 年 4 月,Anthropic 宣布 Claude Mythos 模型并拒绝公开发布——这是自 GPT-2 以来首个因能力过强而被搁置的主流 AI 模型。由此引发的治理问题尚未被严肃讨论:谁有权决定谁能获得此类能力,其他人又有何救济途径?本文是一份工作论文,提出一个集体治理的防御性 AI 系统框架——在架构上受约束、由多方利益相关者共同治理,并能在能力上与威胁对等。这不是产品推销,而是为那些认为当前安排不可持续的人提供的起点。
查看原文
查看缓存全文

缓存时间: 2026/04/22 02:14

chricoho/aegis-cyber-defense-framework

来源:https://github.com/chricoho/aegis-cyber-defense-framework

AEGIS

自主终端守护与情报系统

面向集体、分布式、可问责网络防御的框架

2026 年 4 月,Anthropic 发布 Claude Mythos——一款被认为过于危险而拒绝公开发布的通用 AI 模型。内部测试中,Mythos 在无人类指导的情况下,自主发现了所有主流操作系统和浏览器的零日漏洞,其中包括 OpenBSD 存在 27 年之久的一处缺陷,并构造出可用漏洞利用代码。这些能力并非定向训练所得,而是通用推理与代码能力提升的副产品。
Anthropic 随即启动“Project Glasswing”,将访问权限授予 Microsoft、Google、Apple、Amazon Web Services、JPMorgan Chase 与 Nvidia。名单由 Anthropic 单方面决定,受影响公众无从申诉。

现代网络安全建立在一个前提之上:发现漏洞足够困难,从而天然形成速率限制。该前提可能已失效。一旦崩塌,其上构建的整个大厦不会缓慢削弱,而是彻底瓦解。

本仓库收录一篇工作论文,提出 AEGIS——一个集体治理、架构受限的防御性 AI 系统,可与威胁方保持对等。它不是产品,也不是政府项目,而是一种新型机构的框架,基于三点主张:

  • 无论初衷如何,此种能力集中于私人之手在结构上即不稳定
  • 核时代的威慑逻辑在此适用,但答案应是分布式防御,而非分布式进攻
  • 治理问题必须先于工程问题解决,因为没人会为自己不信任的基础设施投入资源

文档

📄 AEGIS-White-Paper.pdf
工作论文——讨论稿,2026 年 4 月

内容

论文涵盖:

  • 问题篇——速率限制前提为何失效、Project Glasswing 暴露的治理缺口,以及传统应对为何不足
  • 理论框架——威慑类比及其局限,免疫系统模型作为正确替代
  • 技术架构——范围验证、推理引擎、输出限制、分布式部署与透明账本
  • 治理结构——理事会构成、决策阈值、问责机制与资金来源
  • 安全机制——密码学范围强制、输出限制架构、行为监控、红队评估与能力上限
  • 实现路径——三阶段路线图,解决时序难题
  • 异议回应——对四条最严重反对意见的回应

状态

此为工作论文,并非最终方案。它旨在引导机构承诺与概念验证开发——作为起点,而非结论。
目标读者正是具备专业知识与资源、能够将其付诸实践的人。

参与

Issue 与 Fork 均已开放。若你想扩展治理框架、提出技术修改,或指出论证中的错误,请在此仓库进行。
如需直接联系,请开 Issue。

相似文章

AEGIS:物理AI的备份反射

arXiv cs.AI

AEGIS 使用激活探针早期预警,在长时域机器人操作中故障累积之前切换到更强的策略,恢复的故障次数是预算匹配升级策略的两倍。

Anthropic 发布用于 AI 驱动漏洞发现的开源框架

Hacker News Top

Anthropic 发布了一个开源参考实现,用于基于 Claude 的自主漏洞发现与修复,涵盖完整流水线(侦察 → 发现 → 验证 → 报告 → 修补),并支持沙箱隔离。该框架配套 Claude Security 托管产品,可用于管理代码库中的漏洞。

通往AGI之路中的安全保护

OpenAI Blog

OpenAI 概述了在通往 AGI 过程中的全面安全措施,包括由 AI 驱动的网络防御、与 SpecterOps 的持续对抗性红队测试,以及为 Operator 等新兴 AI 代理设计的安全框架。该公司强调主动威胁检测、业界合作,以及安全措施与基础设施和模型的深度集成。

Claude Mythos 开启网络安全的潘多拉魔盒

Reddit r/artificial

Anthropic 发布了 Claude Mythos,这是一款能力极强的 AI 模型,旨在自动发现操作系统、浏览器和软件库中的安全漏洞。出于双重用途风险的考虑,该模型最初仅通过 Project Glasswing 向部分企业和开源合作伙伴开放,此次发布引发了业界关于 AI 安全能力与企业营销策略的广泛争论。