@rauchg: 据内部评估,Kimi K3 在网络安全领域表现顶级。X 上有传言称 Moonshot 基准过拟合。这…
摘要
Vercel Labs 发布了 deepsec,一个开源的、基于代理的漏洞扫描器,它使用顶级 AI 模型按需审查大型代码库,并发现难以发现的漏洞。
查看缓存全文
缓存时间: 2026/07/20 15:33
根据内部评估:Kimi K3 在网络安全方面属于顶级水平。X 上有传言称 Moonshot 存在基准过拟合。这些是隐秘评估。模型拥有原始智商。Sol 在网络能力上领先一大步。虽然成本明显更高,但依然相当出色。Fable 拒绝一切任务。我们完全无法让它完成运行。有趣的是,相比之下 Sol 在协助防御性网络加固方面要开放得多。
TL;DR:前沿、开放权重的网络安全能力已经到来。请访问 http://deepsec.sh 用于防御目的。
vercel-labs/deepsec
来源:https://github.com/vercel-labs/deepsec
deepsec
deepsec 是一个基于智能体的漏洞扫描器,可在您自己的基础设施中运行,针对现有大型仓库中的所有代码进行按需审查进行了优化。deepsec 旨在发现那些长期潜伏在应用程序中、难以被发现的问题。它配置为使用最佳模型并开启最高思考层级(可通过 --thinking-level 调节,详见 docs/models.md),这意味着对于大型代码库,单次扫描的成本可能高达数千甚至数万美元。我们的客户认为,考虑到它能如此迅速地帮助其修补那些原本可能未被修复的漏洞,这个成本是值得的。
对于大型代码库,工作会并行分发到多台工作机器上。如果运行中断或中途出错,只需重新运行相同的命令——deepsec 会从中断处继续,跳过已经分析过的文件,只处理剩余部分。
快速开始
导航到要扫描的仓库根目录,然后执行:
npx deepsec init # 创建 .deepsec/ 目录,并将当前仓库作为首个项目
cd .deepsec
pnpm install # 从 npm 安装 deepsec
# 按照 `init` 输出的指示继续操作
现在让您的编码智能体来引导完成安装。打开您选择的智能体,输入提示:
阅读
.deepsec/node_modules/deepsec/SKILL.md以了解该工具的功能。
然后阅读.deepsec/data/<project_key>/SETUP.md并按照指示操作:
浏览此仓库的 README、任何 AGENTS.md/CLAUDE.md 文件以及少量代表性代码文件,
然后替换.deepsec/data/<project_key>/INFO.md中的每个部分。请保持简短——目标总行数 50-100 行。每个部分选择 3-5 个示例,无需穷举。
命名原始组件(如认证辅助函数、中间件),但不要写行号。
跳过通用的 CWE 类别——内置匹配器已覆盖。
仅覆盖项目特有的内容。
INFO.md 会被注入到每一次扫描批次中;啰嗦的上下文会稀释信号。
然后在 .deepsec/ 目录内执行扫描:
pnpm deepsec scan
pnpm deepsec process
pnpm deepsec revalidate # 可选,降低误报率
pnpm deepsec export --format md-dir --out ./findings
如果您觉得 deepsec 应该查看代码的更多部分,请将 编写匹配器 文档提供给它,以便在代码库中找到更有价值的起点。
文档
- docs/getting-started.md — 首次扫描指南
- docs/reviewing-changes.md — 用于 PR 审查和 CI 门控的
process --diff - docs/supported-tech.md — deepsec 开箱即用的框架和生态系统
- docs/writing-matchers.md — 让您的编码智能体扩展匹配器集
- docs/configuration.md —
deepsec.config.ts参考 - docs/plugins.md — 插件开发
- docs/models.md — 模型选择、默认值、拒绝、未来模型
- docs/vercel-setup.md — AI Gateway + Vercel Sandbox 密钥/令牌
- docs/architecture.md — 流水线内部结构
- docs/data-layout.md —
data/目录模式(FileRecord、RunMeta 等) - docs/faq.md — 成本、模型选择、沙箱模式、误报率
- samples/ — 可直接复制的初始模板(当前:
webapp/) - CONTRIBUTING.md — 仓库布局、开发工作流
AI 提供商
在本地运行时,如果您已在此机器上登录,deepsec 会回退到您现有的 claude / codex 订阅。订阅(Claude Pro/Max、ChatGPT Plus)可用于评估 deepsec,但通常没有足够资源完成完整的仓库扫描。对于真实扫描,请使用 Vercel AI Gateway。一个密钥即可覆盖 Claude 和 Codex,且网关的默认额度专为高并发研究而设计。
AI_GATEWAY_API_KEY=vck_...
请参阅 docs/vercel-setup.md 了解如何获取密钥以及 Vercel Sandbox 的设置。
要绕过网关,请显式设置 ANTHROPIC_AUTH_TOKEN + ANTHROPIC_BASE_URL(或 OpenAI 对应的环境变量组合)。显式设置的值始终优先于 AI_GATEWAY_API_KEY 的扩展值。
如果 process 或 revalidate 运行因上游凭据额度或积分耗尽而停止,deepsec 会优雅地停止并告知您在哪里充值。之后重新运行相同的命令,它会从停止处继续。
分布式执行(可选)
大型单仓库可以将工作分散到 Vercel Sandbox (https://vercel.com/docs/vercel-sandbox) 的微型虚拟机中:
pnpm deepsec sandbox process --project-id my-app --sandboxes 10 --concurrency 4
需要 Vercel 账户。本地工作树会被打包成 tar 包并上传;.git 目录会被排除。支持 OIDC 令牌(本地)和访问令牌(CI)——请参阅 docs/vercel-setup.md。
deepsec 自身的安全模型
请将 deepsec 视为一个对其运行环境拥有完全 shell 访问权限的编码智能体。它设计为在受信任的输入(您的源代码)上运行,但您可能仍然担心由于外部依赖项或第三方代码导致的提示注入。在沙箱中运行(见上文)可以大幅限制潜在风险:
- 编码智能体的 API 密钥在沙箱外部注入,因此无法被窃取
- 对于工作沙箱,从沙箱外出的网络流量仅限于编码智能体主机(引导过程中允许出站流量,但此过程不运行编码智能体)
工作流参考
| 命令 | 功能 |
|---|---|
scan | 使用正则匹配器查找候选点(快速,无需 AI) |
process | AI 调查;输出发现 + 建议 |
process --diff | PR 模式:仅扫描并调查差异中更改的文件 |
triage | 轻量级 P0/P1/P2 分类(使用更便宜的模型) |
revalidate | 重新检查现有发现;检查 git 历史中是否已修复 |
enrich | 添加 git 提交者信息 +(通过插件)所有权数据 |
report | 单个项目的 Markdown + JSON 摘要 |
export | 每个发现一个 JSON 文件或一个 Markdown 文件目录 |
metrics | 跨项目统计:严重级别、按类型分类的漏洞、真阳性 |
status | 项目镜像的快照 |
sandbox <cmd> | 在 Vercel Sandbox 微虚拟机上运行上述任意命令 |
许可证
Apache 2.0。请参阅 LICENSE 和 NOTICE。
Malte Ubl (@cramforce):
我们在一个私有的网络安全基准测试上运行了 Kimi K3。
TL;DR:在召回率/精确率/成本方面,Kimi K3 是网络安全任务的主力。GPT 5.6 在召回率/精确率方面最佳,但每次运行成本高出 7 倍。
背景信息:https://t.co/FVd4XWRfw8 是一个开源的网络攻击/防御框架。
相似文章
Kimi K3 在由英国AISI / CAISI 进行的初步网络评估中,性能显著低于最新前沿网络能力模型。
英国AISI 和美国CAISI 对 Moonshot AI 的 Kimi K3 模型进行了网络能力评估,发现其性能显著低于最新前沿网络能力模型,但高于 GLM-5.2,且其安全防护措施无法阻止智能体网络漏洞利用开发。
Kimi k3 网络安全模型
Kimi k3 是一款专为网络安全应用设计的新型人工智能模型,旨在增强威胁检测和响应能力。
@0x0SojalSec: Kimi K3 可在27分钟内发现一个零日漏洞,仅需一个简单提示即可实现完全RCE并完全利用,无需人工逆向工程…
Kimi K3,一个人工智能模型,被声称能够在27分钟内自主发现一个零日漏洞并通过一个简单提示实现完全远程代码执行(RCE),无需人工逆向工程。
@rauchg: Mythos / Sol 的网络安全能力在攻防两端同样有用。如果对手…
deepsec 是一个基于代理的漏洞扫描器,利用前沿AI模型审查大型代码库,发现难以检测的安全问题。它可以本地运行或在你自己的基础设施上运行,支持并行扫描、恢复功能以及可自定义的匹配器。
关于Kimi K3:其能力与相关不满(70分钟阅读)
Kimi K3是Moonshot AI推出的2.8T参数开放模型,基准测试表现强劲,但可能过度优化,且落后顶级闭源模型数月。它从Claude蒸馏而来,其发布可能先于IPO。