未调优的27B模型在智能体任务中击败了调优的75B模型
摘要
一项比较显示,未调优的27B参数模型在智能体任务中优于调优的75B参数模型,凸显了扩展和微调可能存在的低效问题。
暂无内容
相似文章
发布了一个针对其他模型拒绝执行的代理测试工作进行调优的模型。AgentDojo 实用率 97.5%。
基于 GLM-5.2 的微调模型,经过 abliterated 处理,专门用于代理测试和 red teaming,在 AgentDojo 上实现了 97.5% 的正常实用率,并在强大的编码基准测试中表现优异。
相同模型,相同提示词,两个代理框架:45/50 vs 43/50
文章对相同的deepseek-v4-flash模型上的两个开源编码代理进行了基准测试,发现任务成功率相似,但在性能指标上存在显著差异,并且一个代理的错误处理中存在一个关键漏洞。
@che_shr_cat: 1/ 参数规模是一种蛮力拐杖。如果一个35B模型仅通过扩展其搜索…就能击败1,000B模型呢?
探讨一个35B参数模型是否能够通过在测试时扩展其搜索视界来超越1000B模型,使用结构化过程反馈而非蛮力参数扩展。
AutoTuneBench: 用于LLM服务引擎代理自动调优的可信度量
AutoTuneBench 提出了一个基准和测量协议,用于LLM服务引擎的可信代理自动调优,解决了诸如稻草人基线和基础设施缺陷等故障模式,以确保可靠的结果。
扩展视野而非参数:以35B智能体达到万亿参数性能
介绍了Agents-A1,一个35B混合专家智能体模型,通过长视野轨迹缩放和三阶段训练方法(包括SFT、领域级教师和多教师蒸馏)实现了万亿参数级别的性能。在长视野智能体基准测试中,该模型表现优于或媲美更大规模的模型。