标签
一项大规模实证研究,分析了生产环境中352万次C++代码变更,比较AI生成代码与人工编写代码的质量,发现AI代码具有更高的耦合度和计算开销,但有针对性的反馈可以缓解这些问题。
作者构建了 LintLang,一个用于 agent 配置的确定性 linter,它能在运行时之前捕获结构性的语言缺陷,例如模糊的工具描述和相互冲突的指令,并指出 Character.AI 的 Larch 框架已在 CI 中采用它。这篇文章向开发者询问哪些运行时失败应该被静态捕获。
SafeAI是一款面向AI智能体应用的Apache-2.0静态分析器,可扫描源代码和配置,以发现能力、风险、工具、MCP集成、密钥和治理信号,并生成带版本控制的KYA清单和CI门禁。作者正在寻找贡献者和审阅者。
一款静态分析扫描器测试了五个DTC品牌,发现尽管结构化数据良好,但其自定义JavaScript(例如使用<div>而非<select>的尺码选择器)使得AI购物代理无法访问,可能导致每月因AI推荐流量损失8.2万至49.1万美元的收入。
一位开发者构建了一个基于Go的AI代理,使用只读工具对SAST扫描器的误报进行分类,并在OWASP BenchmarkJava上使用Claude Sonnet、DeepSeek-V4-Pro和Kimi k3进行测试,取得了强劲的结果,尤其是Kimi k3。
描述了开发一个开源静态分析器的过程,该分析器利用多种编码模型来评估AI代理的能力和风险。
Go 分析框架为 Go 代码的静态分析提供模块化接口,支持可复用的检查器,可应用于 vet、IDE 和构建系统等多种工具。
pkgxray 是一款零依赖的静态分析工具,在安装前检查 npm 包和 MCP 服务器,提供 SAFE/REVIEW/BLOCK 判定结果,以防止供应链攻击。
CodeSizer 是一款用于嵌入式固件的静态代码大小分析工具,它利用 objdump 和 addr2line 将代码大小归因于内联调用树,并生成 HTML 报告。
Harness Handbook是一种以行为为中心的表示,通过静态程序分析和LLM辅助从智能体harness代码库中合成,帮助开发者和编码智能体定位实现特定行为的代码。它引入了行为引导的渐进式披露(BGPD),引导智能体从高层描述到相关实现细节,提高了定位准确性和编辑计划质量。
本文形式化描述了'拼凑问题'——即LLM生成的代码在局部正确但在整个代码库中结构上不连贯的现象,提出了一个八类故障分类法和一个混合验证框架,并证明许多故障能够避开现有工具。
本文介绍了InterFLOPBench,这是一个用于评估LLM在C代码中检测浮点错误的基准测试,发现最近的模型取得了较高的F1分数,但性能因错误类型而异。
作者介绍了 FCM Trust,一款用于审查 AI 代理项目的安全性、权限和可靠性的本地扫描器,并向社区询问他们自己的代理工具访问审查方法。
OxCaml 是 Jane Street 的 OCaml 超集,引入了一个 `[@zero_alloc]` 注解,强制编译器在调用树中任何函数在堆上分配内存时拒绝构建,将内存分配检测从运行时分析转变为编译时强制执行。
本文深入介绍了 Linux 内核中 C 语言与普通用户空间 C 的区别,涵盖资源管理、错误处理、并发、日志记录、静态分析等核心技巧,使用了大量 GNU C 扩展和内核特有模式。
本文研究了轻量级静态分析注释如何作为确定性锚定,提高基于LLM的代码智能体在导航软件仓库时的可预测性和可重复性,发现这种锚定改进了定位并减少了方差。
cargo-geiger 是一个 Rust cargo 插件,用于列出 crate 及其依赖中不安全代码使用的统计信息,为审计提供输入。
作者构建了一个代码上下文图解析器,通过静态分析生成图,并通过MCP暴露给AI代理。在与Gemma 4 26B的直接比较中,使用该图的代理在不到2分钟内探索了Apache Kafka的请求流程,而没有图的基线代理在6分钟内耗尽了速率限制。
brooks-lint 是一个基于十二本经典软件工程书籍的 AI 代码审查工具,提供结构化的、可追溯的代码衰退风险评估与修复建议,旨在避免 AI 生成的代码质量问题。
Anthropic 发布了一个开源代码审计参考工具,用于使用 Claude 进行自主漏洞发现和修复,涵盖了 recon→find→triage→report→patch 流程,主要针对 C/C++ 内存漏洞。它是一个模板/参考实现,而非生产就绪产品,同时还提供名为 Claude Security 的托管选项。