@rauchg: 据内部评估,Kimi K3 在网络安全领域表现顶级。X 上有传言称 Moonshot 基准过拟合。这…

X AI KOLs Following 工具

摘要

Vercel Labs 发布了 deepsec,一个开源的、基于代理的漏洞扫描器,它使用顶级 AI 模型按需审查大型代码库,并发现难以发现的漏洞。

根据内部评估: Kimi K3 在网络安全方面是顶级水平 X 上有传言称 Moonshot 存在基准过拟合。这些都是隐蔽评估。模型具有原始 IQ。 Sol 在网络能力方面领先一大步 尽管成本明显更高,但仍然相当出色。 Fable 拒绝一切 我们根本无法让它完成运行。有趣的是,相比之下 Sol 在帮助进行防御性网络安全加固方面要开放得多。 TL;DR:前沿的、开放权重的网络安全能力已经到来。请访问 http://deepsec.sh 进行防御性测试。
查看原文
查看缓存全文

缓存时间: 2026/07/20 15:33

根据内部评估:Kimi K3 在网络安全方面属于顶级水平。X 上有传言称 Moonshot 存在基准过拟合。这些是隐秘评估。模型拥有原始智商。Sol 在网络能力上领先一大步。虽然成本明显更高,但依然相当出色。Fable 拒绝一切任务。我们完全无法让它完成运行。有趣的是,相比之下 Sol 在协助防御性网络加固方面要开放得多。
TL;DR:前沿、开放权重的网络安全能力已经到来。请访问 http://deepsec.sh 用于防御目的。


vercel-labs/deepsec

来源:https://github.com/vercel-labs/deepsec

deepsec

deepsec 是一个基于智能体的漏洞扫描器,可在您自己的基础设施中运行,针对现有大型仓库中的所有代码进行按需审查进行了优化。deepsec 旨在发现那些长期潜伏在应用程序中、难以被发现的问题。它配置为使用最佳模型并开启最高思考层级(可通过 --thinking-level 调节,详见 docs/models.md),这意味着对于大型代码库,单次扫描的成本可能高达数千甚至数万美元。我们的客户认为,考虑到它能如此迅速地帮助其修补那些原本可能未被修复的漏洞,这个成本是值得的。

对于大型代码库,工作会并行分发到多台工作机器上。如果运行中断或中途出错,只需重新运行相同的命令——deepsec 会从中断处继续,跳过已经分析过的文件,只处理剩余部分。

快速开始

导航到要扫描的仓库根目录,然后执行:

npx deepsec init # 创建 .deepsec/ 目录,并将当前仓库作为首个项目  
cd .deepsec  
pnpm install    # 从 npm 安装 deepsec  
# 按照 `init` 输出的指示继续操作  

现在让您的编码智能体来引导完成安装。打开您选择的智能体,输入提示:

阅读 .deepsec/node_modules/deepsec/SKILL.md 以了解该工具的功能。
然后阅读 .deepsec/data/<project_key>/SETUP.md 并按照指示操作:
浏览此仓库的 README、任何 AGENTS.md/CLAUDE.md 文件以及少量代表性代码文件,
然后替换 .deepsec/data/<project_key>/INFO.md 中的每个部分。

请保持简短——目标总行数 50-100 行。每个部分选择 3-5 个示例,无需穷举。
命名原始组件(如认证辅助函数、中间件),但不要写行号。
跳过通用的 CWE 类别——内置匹配器已覆盖。
仅覆盖项目特有的内容。
INFO.md 会被注入到每一次扫描批次中;啰嗦的上下文会稀释信号。

然后在 .deepsec/ 目录内执行扫描:

pnpm deepsec scan  
pnpm deepsec process  
pnpm deepsec revalidate   # 可选,降低误报率  
pnpm deepsec export --format md-dir --out ./findings  

如果您觉得 deepsec 应该查看代码的更多部分,请将 编写匹配器 文档提供给它,以便在代码库中找到更有价值的起点。

文档

AI 提供商

在本地运行时,如果您已在此机器上登录,deepsec 会回退到您现有的 claude / codex 订阅。订阅(Claude Pro/Max、ChatGPT Plus)可用于评估 deepsec,但通常没有足够资源完成完整的仓库扫描。对于真实扫描,请使用 Vercel AI Gateway。一个密钥即可覆盖 Claude 和 Codex,且网关的默认额度专为高并发研究而设计。

AI_GATEWAY_API_KEY=vck_...  

请参阅 docs/vercel-setup.md 了解如何获取密钥以及 Vercel Sandbox 的设置。

要绕过网关,请显式设置 ANTHROPIC_AUTH_TOKEN + ANTHROPIC_BASE_URL(或 OpenAI 对应的环境变量组合)。显式设置的值始终优先于 AI_GATEWAY_API_KEY 的扩展值。

如果 processrevalidate 运行因上游凭据额度或积分耗尽而停止,deepsec 会优雅地停止并告知您在哪里充值。之后重新运行相同的命令,它会从停止处继续。

分布式执行(可选)

大型单仓库可以将工作分散到 Vercel Sandbox (https://vercel.com/docs/vercel-sandbox) 的微型虚拟机中:

pnpm deepsec sandbox process --project-id my-app --sandboxes 10 --concurrency 4  

需要 Vercel 账户。本地工作树会被打包成 tar 包并上传;.git 目录会被排除。支持 OIDC 令牌(本地)和访问令牌(CI)——请参阅 docs/vercel-setup.md

deepsec 自身的安全模型

请将 deepsec 视为一个对其运行环境拥有完全 shell 访问权限的编码智能体。它设计为在受信任的输入(您的源代码)上运行,但您可能仍然担心由于外部依赖项或第三方代码导致的提示注入。在沙箱中运行(见上文)可以大幅限制潜在风险:

  • 编码智能体的 API 密钥在沙箱外部注入,因此无法被窃取
  • 对于工作沙箱,从沙箱外出的网络流量仅限于编码智能体主机(引导过程中允许出站流量,但此过程不运行编码智能体)

工作流参考

命令功能
scan使用正则匹配器查找候选点(快速,无需 AI)
processAI 调查;输出发现 + 建议
process --diffPR 模式:仅扫描并调查差异中更改的文件
triage轻量级 P0/P1/P2 分类(使用更便宜的模型)
revalidate重新检查现有发现;检查 git 历史中是否已修复
enrich添加 git 提交者信息 +(通过插件)所有权数据
report单个项目的 Markdown + JSON 摘要
export每个发现一个 JSON 文件或一个 Markdown 文件目录
metrics跨项目统计:严重级别、按类型分类的漏洞、真阳性
status项目镜像的快照
sandbox <cmd>在 Vercel Sandbox 微虚拟机上运行上述任意命令

许可证

Apache 2.0。请参阅 LICENSENOTICE

Malte Ubl (@cramforce):
我们在一个私有的网络安全基准测试上运行了 Kimi K3。
TL;DR:在召回率/精确率/成本方面,Kimi K3 是网络安全任务的主力。GPT 5.6 在召回率/精确率方面最佳,但每次运行成本高出 7 倍。
背景信息:https://t.co/FVd4XWRfw8 是一个开源的网络攻击/防御框架。

相似文章

Kimi k3 网络安全模型

Reddit r/LocalLLaMA

Kimi k3 是一款专为网络安全应用设计的新型人工智能模型,旨在增强威胁检测和响应能力。