发布了一个针对其他模型拒绝执行的代理测试工作进行调优的模型。AgentDojo 实用率 97.5%。
摘要
基于 GLM-5.2 的微调模型,经过 abliterated 处理,专门用于代理测试和 red teaming,在 AgentDojo 上实现了 97.5% 的正常实用率,并在强大的编码基准测试中表现优异。
我们需要一个能够真正完成长序列对抗性代理轨迹的模型,而不是拒绝或偏离。大多数前沿模型仍然会放弃大量此类工作。因此,我们对 GLM-5.2 进行了 abliterated 处理,并针对进攻性网络安全、red teaming 和代理测试进行微调。结果就是 abliterated-model-large。AgentDojo 数据:正常实用率:97.5%,攻击下实用率:34.29%,目标攻击成功率:57.86%。该模型在 SWE-bench Verified 上达到了 81.2%,在 Terminal-Bench 2.1 上达到了 80.1%,因此编码能力并未下降。API 与 OpenAI / Anthropic 兼容,可即插即用。默认零保留。没有预设的拒绝机制。策略由你控制。如果大家能分享当前如何测试代理以对抗中途拒绝的模型,那将非常有用。你们正在使用哪些基准测试或设置?
相似文章
我们发布了一个经abliterated处理和微调的GLM-5.2模型。在对抗性基准测试中取得高分,同时保持了编码性能。
我们发布了一个经过abliterated处理和微调的GLM-5.2版本(abliterated-model-large),在对抗性和智能体基准测试中取得了高分,同时保持了编码性能。该模型通过API提供,默认零数据留存,且没有内置策略。
Prime Agent —— 超越 Codex/CC/PI 的新型编码框架
Prime Agent 是一个开源编码与研究框架,性能超越专有框架,在 ARC-AGI-3 上得分 95.5%,并在多个基准测试中提升模型表现。
它是否具备足够的代理能力?使用你自己的工具对开放模型进行基准测试
这篇博客文章介绍了一种基准测试方法,用于评估开放模型在代理编程任务上的表现,不仅关注准确性,还关注代理过程的效率。它提供了一个使用 pi coding agent 的可定制工具框架,并在不同模型和库版本上进行测试。
Agent Arena Code - GLM 和 Qwen 的初步表现非常出色!
Agent Arena Code 的初步结果显示 GLM 和 Qwen 模型表现良好,这表明开放权重的AI模型取得了进步。
AgentDoG 1.5: 轻量且可扩展的AI智能体安全与防护对齐框架
本文提出AgentDoG 1.5,一个面向AI智能体安全的轻量可扩展对齐框架,利用基于分类树引导的训练,仅需极少量样本即可达到与领先闭源模型相当的性能。