标签
本文研究在LLM代理中应于何处实施精确一次行为以防止重复副作用,使用名为Limbo的确定性沙盒,在各种故障条件下对模型、工具框架和工具契约进行测试。
本文介绍了一个确定性测试平台,用于评估LLM评判器在智能体轨迹上的表现,表明仅基于结果的评判器会遗漏静默故障,而基于步骤的评判器能达到更高的召回率并具有更好的校准。
本文介绍了GPU降压作为一种硬件级防御手段,通过引入有益的随机故障来提高训练过程中CNN的对抗鲁棒性和能效。
本文介绍了TS-Fault,这是一个用于评估时间序列预测模型在结构化故障场景(如依赖关系断裂和机制变化)下的基准测试。研究发现,干净数据上的准确性通常与鲁棒性呈负相关,且基础模型特别脆弱。
对Antithesis的深入探讨,这是一款针对大型分布式系统的多重宇宙调试器,提供确定性重放和故障注入功能,现已作为免费文章发布。
AI编码代理的两项技能,用于设计和运行面向分布式及有状态系统的声明驱动测试,生成结构化的测试计划和发现报告,包含9种状态判定和归责分类。