发布了一个针对其他模型拒绝执行的代理测试工作进行调优的模型。AgentDojo 实用率 97.5%。

Reddit r/AI_Agents 模型

摘要

基于 GLM-5.2 的微调模型,经过 abliterated 处理,专门用于代理测试和 red teaming,在 AgentDojo 上实现了 97.5% 的正常实用率,并在强大的编码基准测试中表现优异。

我们需要一个能够真正完成长序列对抗性代理轨迹的模型,而不是拒绝或偏离。大多数前沿模型仍然会放弃大量此类工作。因此,我们对 GLM-5.2 进行了 abliterated 处理,并针对进攻性网络安全、red teaming 和代理测试进行微调。结果就是 abliterated-model-large。AgentDojo 数据:正常实用率:97.5%,攻击下实用率:34.29%,目标攻击成功率:57.86%。该模型在 SWE-bench Verified 上达到了 81.2%,在 Terminal-Bench 2.1 上达到了 80.1%,因此编码能力并未下降。API 与 OpenAI / Anthropic 兼容,可即插即用。默认零保留。没有预设的拒绝机制。策略由你控制。如果大家能分享当前如何测试代理以对抗中途拒绝的模型,那将非常有用。你们正在使用哪些基准测试或设置?
查看原文

相似文章