标签
本文提出了DNSSE,一种混合框架,结合了基于LLM的调度预测、符号约束求解和覆盖引导的随机变异,用于验证分布式并行AI程序。它在现实基准上检测到的并发缺陷数量是基线的2.9倍,并将分支覆盖率从68.6%提高到91.6%。
MetaSpace 是一个框架,应用蜕变测试来评估具身智能体的空间认知能力,从执行轨迹中生成测试用例,并将逻辑/物理约束编码为 Prolog 规则。基准测试表明,最先进的 MLLM 驱动的智能体在空间认知上的得分远低于人类水平,其中方向性任务尤为薄弱。
一篇实地笔记认为,全绿的测试套件并不能证明测试是有意义的;应该让AI代理尝试让测试失败,以验证它们确实能捕获bug。
freeCodeCamp 宣布推出一个关于使用 Playwright 进行软件测试的综合课程,涵盖测试金字塔、TDD、API 测试等基础知识,以及像 KaneAI 这样的 AI 驱动工具。
Antithesis发布了一篇博客文章,详细介绍了在多个开源Raft共识实现(包括HashiCorp Raft和OpenRaft)中发现的Bug,强调了测试分布式系统的困难以及对更好工具的需求。
Antithesis 描述了其定制的确定性虚拟机监控器和子树去重技术,用于在云规模上进行高效、可重复的全系统模糊测试。
来自Antithesis的一篇详细博客文章,描述了他们的软件测试工具如何用于探索并实现Tetris中的‘重生’(达到255级),在此过程中克服挑战并发现故障。
Momentic 宣布重大平台更新,推出基于AI的知识库和自主测试代理,以应对代码速度与软件质量之间日益扩大的差距。
一条推文认为,AI 应用测试应成为编码应用的一流功能,并指出如果让 AI 自行尝试应用,许多明显问题都可以被发现。
使用Codex通过生成用户故事并在迭代循环中在电子表格中跟踪功能状态,来自动化应用测试。
Gergely Orosz 分享了他使用 Antithesis 的经验,这是一个确定性测试基础设施,可以在几分钟内完成数小时的测试。
本文认为,由于输入空间无限且行为非确定性,AI代理使用固定输入和预期输出的标准测试套件并不充分,主张应采用基于属性的测试方法。
作者分享了一项适用于AI智能体的测试驱动开发技能,旨在改进测试编写,基于Kent Beck的Canon TDD,并提供了GitHub链接。
作者测试了Persistent Sage的长期记忆功能,发现它能够准确地回忆起一周前告知的个人事实,如色盲和配偶的名字,而无需明确提示,展示了AI智能体的有效持久记忆。
作者离开职场后,好奇大厂QA的工作流是否仍是测出bug后提ticket,并认为提bug本身可视为给AI的提示词,不如直接让AI修改代码。
本文探讨了为什么在规范或测试中添加假设会从逻辑上弱化所得性质,使用了逻辑蕴含以及来自形式化方法和 Rust 的示例。此外,还讨论了尽管存在这种弱化,仍使用假设的实际原因。
一条推文分享了一个提示,将 Composer 2.5 配置为QA工程师,为开发阶段创建测试文档和错误报告。
一位开发者将Claude Code连接到iPhone模拟器,并提示它“测试一切”,结果实现了自主导航、漏洞检测和结构化报告,展示了从传统测试脚本到AI驱动的意图测试的转变。
本文用Python实现了一个Daikon风格的运行时不变量挖掘器,包括插桩、轨迹收集、候选不变量检查以及基于蕴含的抑制,为回归测试提供了一个近似预言。