标签
HARDEN 引入约束进化搜索,以生成更难且保留预期输出的语言模型评估案例,从而在多个基准测试中显著降低了准确性。
研究人员提出了一种利用LLM代理的对抗性黑客-修复循环,自动修补代理基准测试中脆弱的验证器,在KernelBench上将攻击成功率从62%降至0%,并证明较弱的防御者可以压制更强的攻击者。