标签
Specula是一个代理系统,能够自动从代码推导TLA+规范,运行模型检查以发现并发错误,并通过集成测试复现这些错误。它在48个开源分布式和并发系统中发现了249个错误,展示了形式化验证的显著扩展。
本文提出了一种算子感知的校准方法,用于张量核正确性测试中的绝对容差校准,利用误差分布数据设定更严格的阈值。该方法在缺陷检测中将召回率绝对提升了9.3%,且误报极少,在gpuemu语料库上得到了验证。
Decypher 是一种深度语义代码图工具,可帮助 AI 智能体理解代码结构、数据流和安全问题,现已针对 Java 及 JVM 语言推出测试版。
一位用户对Fable 5的安全机制表示不满,该机制阻止了对自己代码的安全漏洞分析,质疑该模型相对于Opus 4.8的实用性,并向社区寻求实际用例。
Greptile 推出 TREX,这是一款能够执行代码并检测运行时错误的 AI 代码审查工具。它超越了静态分析,通过启动并行代理来调查问题并生成截图等产物。
Greptile 推出 T-Rex,该功能可在沙箱中运行你的分支,通过模拟 API 调用、点击 UI 界面以及运行单元测试来发现错误,相比基础版 Greptile 能多捕获约 20% 的错误。
作者构建了一个AI驱动的PR审核工作流,可生成实际修复PR而不仅仅是评论,声称比CodeRabbit便宜6倍,且在处理大型PR时更准确。
Microsoft Research 的这篇论文介绍了一种随机调度技术,旨在为发现软件系统中的 Bug 提供概率性保证。该成果已发表于 ASPLOS 会议,核心在于利用算法随机性来实现系统化的故障检测。