首页
/
模型
/
我们有一年时间来全面解决安全问题
我们有一年时间来全面解决安全问题
摘要
文章讨论了GLM 5.3-flash的发布,这是一款开放权重的AI模型,经济实惠且功能强大,引发了对其可能被滥用于黑客活动的担忧。文章呼吁使用前沿的LLMs,对整个科技行业的安全漏洞采取紧急行动。
暂无内容
查看缓存全文
缓存时间:
2026/09/08 06:35
# 我们还有一年时间修复全方位的安全问题
来源:https://jyn.dev/a-year-to-fix-security
上周发布的GLM 5.3-flash(https://z.ai/blog/glm-5.3-flash)意味着Project Glasswing(https://www.anthropic.com/glasswing)和Daybreak(https://openai.com/index/daybreak-for-frontline-defenders/)项目的时间即将告罄。如今,能够执行危险黑客攻击的廉价模型已向所有人开放,且缺乏常规的恶意行为拒绝机制。我们必须在全行业修复漏洞,以免措手不及。这是计算机史上首次,我们具备这样的能力!我们可利用比人类行动更快的前沿大语言模型,在剩余时间内定位并修复这些问题。而最艰巨的挑战在于如何部署这些修复方案。
对大多数人而言,这些话可能显得荒诞或反应过度,因此需要具体解释:
- “GLM”是一种大语言模型(AI)。GLM系列属于**开放权重模型**,意味着任何人都可以下载并运行。
- “Flash”指其运行**成本低廉**且**速度快**,相较于大多数“前沿”模型。“廉价”是相对概念,但本地运行的硬件成本大约在5,000-15,000美元之间。
- “前沿”在此指该模型“接近当前AI能力极限”。
- Project Glasswing和Daybreak是旨在利用大语言模型修复整个科技行业安全问题的倡议。
- “恶意行为”包括入侵基础设施和指导制造管状炸弹等。
下文将详细阐述为何我认为这是迫在眉睫的威胁,以及我们的应对之策。
## GLM
https://jyn.dev/a-year-to-fix-security#glm
全世界任何人都可以下载并修改GLM 5.3-flash。
GLM(“通用语言模型”)系列由智谱AI(原Z.ai Co.)开发,这是一家中国AI实验室。当模型由Z.ai托管时,会附带法律要求的限制:
GLM 5.3-flash拒绝提供管状炸弹的制造方法
Z.ai在互联网上公开发布其模型(https://huggingface.co/zai-org/GLM-5.3-Flash/)(“开放权重”模型)。随后,DeAlignAI(https://dealign.ai/)等机构会发布“去约束”模型(https://huggingface.co/dealignai/GLM-5.3-Flash-ABLITERATED-NVFP4),通过技术手段移除了任务拒绝功能。DeAlignAI声称该去约束模型在Harmbench-320(https://www.harmbench.org/)测试中得分为0%,该测试评估模型是否拒绝执行涉及虚假信息、网络犯罪、生物武器及其他非法行为(如制造管状炸弹)的任务。
换言之,该模型几乎愿意执行任何任务。
## Flash
https://jyn.dev/a-year-to-fix-security#flash
GLM 5.3-flash可在普通消费级硬件上本地运行。
“Flash”主要是营销术语——是相对于其他模型而言,并非特定技术方法。网络上已有用户在本地运行GLM 5.3-flash的基准测试。其中一个示例(https://dev.classmethod.jp/en/articles/dgx-spark-glm-5-3-flash-first-touch/)显示,在约6,000美元的NVIDIA GPU上可达到约20令牌/秒的速度。
9月22日,苹果将发布配备256GB统一内存的M5 Mac Studio。“统一内存”意味着可在操作系统和GPU间共享。这足以运行5.3-flash模型,发布时可能达到约30令牌/秒的速度。256GB版本的起价约为9,500美元。
通过模型解码器优化(https://arxiv.org/abs/2607.00501),软件层面的进一步改进可使吞吐量提升50%。若推算至M5芯片,总吞吐量可能达到约45令牌/秒。
45令牌/秒的速度足以在3秒内生成以下代码片段:
⚠️ LLM生成代码
```python
from pathlib import Path
import hashlib
def digest(path: Path) -> str:
hasher = hashlib.sha256()
with path.open("rb") as file:
while chunk := file.read(1024 * 1024):
hasher.update(chunk)
return hasher.hexdigest()
def main() -> None:
import sys
if len(sys.argv) < 2:
raise SystemExit("usage: hash.py FILE...")
for name in sys.argv[1:]:
path = Path(name)
try:
print(f"{digest(path)} {path}")
except OSError as error:
print(f"{path}: {error}", file=sys.stderr)
if __name__ == "__main__":
main()
```
这意味着普通个人完全有能力用储蓄购置硬件,全天候高速运行该模型。
## 前沿
https://jyn.dev/a-year-to-fix-security#frontier
GLM 5.3-flash的能力已非常接近我们创造的最佳AI水平。现有AI已在现实世界中发现并利用真实安全漏洞。未来AI的能力将持续增强。
GLM 5.3在CyberGym上得分(https://docs.z.ai/guides/llm/glm-5.3#emergent-cyber-capability)84.5%,在ExploitBench上得分54.4%。虽无5.3-flash的直接数据,但成绩应大致相当或略低。去约束模型的分数会稍低。
CyberGym评估的是已被开源项目发现并修补的**真实世界漏洞**。这意味着在该代表性样本中,GLM 5.3仅通过公开源码和CVE描述就能复现84.5%的漏洞。
ExploitBench测试模型能否利用漏洞造成实际危害,采用滑动评分制(部分利用可获部分分数),最终步骤为实现任意代码执行。
对比之下,ExploitBench上的领先(“前沿”)模型是GPT-6 Astra(100%),GPT-5.6 Sol以78.5%位居第二。CyberGym上的领先模型是……GLM-5.3,GPT-5.6 Sol以83.6%次之。OpenAI尚未公布Astra在CyberGym的表现,但未来数据很可能超越GLM 5.3。
网络安全评估可视化数据
你可能认为这些只是合成基准测试,但安全专家已报告(https://blog.includesecurity.com/2026/04/ctfs-in-the-ai-era/),若不借助大语言模型,他们将无法在安全竞赛中保持竞争力。
针对远程代码执行和逆向工程漏洞的标准基准测试不多,但有证据表明GPT 5.6-Sol(https://openai.com/index/hugging-face-incident-and-the-road-ahead/)曾在无人类干预的情况下利用现实世界基础设施。
我认为人们完全可能将GLM 5.3-flash指向开放互联网——真实服务、真实基础设施——而它将有能力且愿意发现并利用漏洞。
## 事态严重性
https://jyn.dev/a-year-to-fix-security#this-is-bad
综合来看意味着:
- 任何略有积蓄的人都能持续运行GLM 5.3-flash,日夜不休。
- 任何人都能将GLM 5.3-flash用于几乎任何任务,包括恶意用途。
- GLM 5.3-flash在这些任务上如此强大,以至于人类参与可以微乎其微。
结果是,我们现在所处的世界,网络安全攻击可以在`for`循环中执行(https://manishearth.github.io/blog/2026/06/17/the-future-of-the-con-is-already-here/)。
目前,美国前沿实验室早已预见这一趋势,正努力推出安全补丁。Project Glasswing(https://www.anthropic.com/glasswing)和Daybreak(https://openai.com/index/daybreak-for-frontline-defenders/)已与科技行业的公司、基金会、政府及非政府组织合作,在这一能力开源前利用前沿模型发现并修复漏洞。他们已做出诸多贡献,我很庆幸这些项目获得了资助。两者在初始资助后均被商业化,虽可能略显不妥,但至少向安全机构提供免费额度。
然而,我们的时间所剩无几。尽管Daybreak和Glasswing成效显著,**部署**修复方案才是难题,而非修复漏洞本身。关键系统通常需要物理接触或精心规划的分阶段部署以避免停机,这两者都会延迟补丁部署。即使Linux内核已修复,若电网运行的是Windows Server 2012,补丁也无济于事。
需注意的是:1.5倍提速在GLM 5.3-flash上可能不显著;去约束模型在其未训练的恶意任务上表现可能较差;从“破坏此系统”到完整漏洞利用可能需要大量人类参与。但这些都是暂时的,模型能力持续提升。历史上,GLM比OpenAI和Anthropic落后约3-6个月,我认为明年此时我们可能会看到Astra级别的GLM模型。届时,公共或私人基础设施遭受成功网络攻击的风险将剧增。我们可能比预期更早体验到(https://jyn.dev/brownouts-reveal-system-boundaries/)电网局部崩溃的教训。
总体而言,攻击者的进化速度比防御者更快。即使模型停止快速扩展(目前并无迹象),它们迟早会具备利用这些漏洞的能力。我们必须立即行动,越快越好。
## 应对之策
https://jyn.dev/a-year-to-fix-security#what-do-we-do
事态正迅速变得复杂且令人担忧。我们需要紧急行动而非恐慌。以下是一些可行措施:
### 政府与监管机构
https://jyn.dev/a-year-to-fix-security#governments-and-regulatory-agencies
使用前沿模型进行扫描成本较低,无需重大激励。真正需要激励的是**部署**和**修复**环节,以及迫使组织审视自身安全实践。按当前政策趋势,最大风险是大量未经分类的警告永远得不到修复。
若你有条件制定政策,以下建议将有所帮助:资助安全工程,最好提供灵活拨款供组织自主决定用于招聘或技术产品。建立并激励安全改进机制,尤其推广定期渗透测试。鼓励使用前沿模型辅助人工监督渗透测试。鼓励增加物理隔离,谨慎使用空中更新:更新应频繁但需物理接触。对无法物理隔离的系统,鼓励频繁、签名验证且经过测试的部署。对**未**定期调查和修正安全态势的行为加大处罚,若因疏忽导致攻击则加重处罚。要求在发现漏洞后按风险等级设定修复时限,并提供联邦资金支持修复。软硬兼施。
以下具体措施值得探讨:
- 务必资助地方政府和医院,因其难以通过其他渠道获得资金。行政命令EO 14409(https://www.whitehouse.gov/presidential-actions/2026/06/promoting-advanced-artificial-intelligence-innovation-and-security/)力度不足,因其缺乏资金且非强制。
- 对银行业,扩展欧盟DORA的TLPT(https://eba.europa.eu/activities/single-rulebook/regulatory-activities/operational-resilience/joint-regulatory-technical-standards-specifying-elements-related-threat-led-penetration-tests)和美国FTC(https://www.ftc.gov/business-guidance/resources/ftc-safeguards-rule-what-your-business-needs-know?utm_source=chatgpt.com)/OCC(https://www.ecfr.gov/current/title-12/chapter-I/part-30/appendix-Appendix%20B%20to%20Part%2030)/NCUA(https://www.ecfr.gov/current/title-12/chapter-VII/subchapter-A/part-748)的范围。TLPT应提高渗透测试频率与覆盖率。NCUA目前仅建议测试,应升级为强制要求。FTC未要求拥有“持续监控”的金融机构进行测试,应改为无条件强制。
- 对美国电力企业,在州和地方层面采用类似NERC关键基础设施保护(https://www.nerc.com/standards/reliability-standards/cip)的指南,覆盖目前未受监管的配电系统及其他系统,而非仅针对最高风险系统。设立联邦资助推动实施。扩展NERC-CIP要求所有系统(不仅是高影响系统)进行主动测试。提高NERC-CIP及欧盟NIS2(https://eur-lex.europa.eu/legal-content/EN/TXT/?uri=CELEX%3A02022L2555-20221227)/网络安全网络规范(https://eur-lex.europa.eu/legal-content/EN/TXT/?uri=CELEX%3A02024R1366-20250914)的测试频率。
- 美国电信业目前风险高且无统一强制网络安全标准。应制定并执行标准,可参考银行业和电力公司的现有法规。
整体而言,要求**频繁**更新安全态势。指定具体模型或供应商的政策将随新模型发布而过时。该领域变化迅速,12个月前有效的防御措施可能在一年后随威胁模型(双重含义)变化而失效。应强制要求测试与问责,而非指定具体技术。
短期内禁止在美国或欧洲托管GLM 5.3-flash权重几乎无效,长期则完全无用。短期内它只会重新出现在文件分享网站;打击它与打击盗版一样困难。长期来看,其他实验室将发布同等能力的模型。
全面禁止Mythos或Astra的访问会适得其反;这将在防御者最需要时剥夺其最强工具。应参考前沿实验室的做法,限制授权组织及个人访问。除非某实验室出现违规迹象,否则可能无需新政策。
禁止新GPU或大容量统一内存的销售/出口或许能延长一年窗口期,但长期无益。这无法影响现有硬件,且极不得人心。尤其是内存难以监管,因其**所有设备**都需使用,而不仅是专用AI系统。
总体而言,应优先制定针对安全发现**分类**与**修复**的政策。发现漏洞的成本已极低;修复成本则不然。
### 企业与开源基金会
https://jyn.dev/a-year-to-fix-security#companies-and-open-source-foundatures
利用涌入行业的(数以十亿计)美元全面提升安全性。尽可能雇佣安全工程师并资助现有维护者。指导工程师和维护者**分类**、**设计**、**审查**、**移植**及**部署**补丁,而非主要专注于发现漏洞或编写新代码。
善用Astra、Mythos等前沿模型,在攻击者之前发现风险。采用结构化提示(如Google的Unsafe Rust审查指南(https://github.com/google/rust-skills/tree/main/unsafe_rust_review));这比简单要求“仔细找漏洞”有效得多。
大语言模型擅长编写补丁,但非一次性提示(https://1password.com/blog/why-ai-generated-patches-still-require-human-review)所能实现。提供结构化提示及迭代自检循环(https://codeberg.org/jyn514/paracress/src/branch/code-dump/.agents/skills/_implementation-closeout.md),直至模型自身判断补丁质量过关。尽可能让模型测试自身修复成果,而非……
相似文章
Reddit r/LocalLLaMA
一篇文章讨论了新闻界对开源AI模型GLM-5.2的危言耸听,该模型可在任何硬件上运行,擅长网络安全任务,引发了有关潜在滥用和审查的担忧。
Wired
Z.ai发布了GLM 5.3,这是一款强大的开源AI模型,专用于编程和网络安全任务,性能可与Anthropic和OpenAI的领先模型相媲美,具有在防御性安全中的潜在应用,但同时也引发了对其被滥用的担忧。
Reddit r/ArtificialInteligence
This article covers a security podcast discussion on the risks of open-weight AI models like GLM 5.2, which attackers can modify and exploit, and introduces CISA's new BOD 26-04 directive that replaces the CVSS scoring system with a four-variable dynamic prioritization model for federal agencies.
Hacker News Top
GLM-5.3 是一款增强的开源权重 AI 模型,专为代理编码和网络防御设计,现已可供下载和定制。相比 GLM-5.2 有显著改进,并在多个基准测试中表现出最先进的性能。
Reddit r/LocalLLaMA
本文分析了本地和云端AI模型在网络安全方面的性能,显示像GLM 5.1和deepseek-v4-flash这样的开源模型在发现公开GitHub代码库的安全漏洞方面优于专有模型。