agent-benchmarks

标签

Cards List
#agent-benchmarks

我们是否遗漏了代理运行时的基准,而不仅仅是模型?

Reddit r/LocalLLaMA · 2026-09-11

本文讨论了需要建立一个基准来独立评估AI代理运行时而非仅仅模型,建议衡量任务成功率、成本等指标,并提出通过对照实验来比较不同平台。

0 人收藏 0 人点赞
#agent-benchmarks

@heyshrutimishra: 350亿参数模型在代理基准测试上几乎匹配1万亿参数模型,完全改变了成本计算方式。Apodex 1.1 mini 在 APEX-Agents 上得分27.7。…

X AI KOLs Timeline · 2026-08-25 缓存

Apodex 1.1 mini 在代理基准测试上取得了竞争性的性能,参数远少于像 Kimi K2.6 这样的大型模型,突出了部署成本优势。

0 人收藏 0 人点赞
#agent-benchmarks

@rohanpaul_ai: 如果你能支付一次推理成本,然后将模型所学用于未来的任务?新的微软论文…

X AI KOLs Following · 2026-08-15 缓存

微软的一篇论文提出了一种方法,用过去代理运行中蒸馏的技能来替代昂贵的测试时推理,在某些基准测试中表现出竞争力,同时减少了输出令牌的使用。

0 人收藏 0 人点赞
#agent-benchmarks

The official release Deepseek V4 flash is live on the API

Reddit r/LocalLLaMA · 2026-07-31 缓存

DeepSeek officially released DeepSeek-V4-Flash on the API in public beta, with significantly enhanced agent capabilities, new benchmark results, and native support for the Responses API and Codex integration.

0 人收藏 0 人点赞
#agent-benchmarks

用于工业4.0智能体评估的合成场景生成

arXiv cs.AI · 2026-07-28 缓存

本文扩展了AssetOpsBench,增加了智能电网变压器资产类别,并引入了ScenarioGeneratorAgent,一个用于合成工业智能体场景生成的流水线,在保持场景质量的同时实现了8倍的运行时间改进。

0 人收藏 0 人点赞
#agent-benchmarks

一个开放权重、MIT许可证的万亿参数模型(蚂蚁的Ring-2.6)据称在推理和智能体基准测试上与封闭前沿模型匹敌。“开放”模型追赶上来真的会改变发展轨迹吗?

Reddit r/singularity · 2026-07-14

文章报道,蚂蚁的Ring-2.6,一个MIT许可下的开放权重万亿参数模型,据称在推理和智能体基准测试上与封闭前沿模型不相上下,引发了对开放模型追赶上来会产生何种影响的疑问。

0 人收藏 0 人点赞
#agent-benchmarks

通过智能体轨迹剖析模型行为

arXiv cs.AI · 2026-06-17 缓存

本文介绍了Simple Strands Agent (SSA),这是一个最小化的框架,旨在缩小AI模型与其智能体行为之间的意图-执行差距,并通过分析各类模型家族的138k条轨迹,揭示细粒度的行为差异。

0 人收藏 0 人点赞
#agent-benchmarks

通过对抗性黑客-修复循环强化代理基准测试

Hugging Face Daily Papers · 2026-06-08 缓存

研究人员提出了一种利用LLM代理的对抗性黑客-修复循环,自动修补代理基准测试中脆弱的验证器,在KernelBench上将攻击成功率从62%降至0%,并证明较弱的防御者可以压制更强的攻击者。

0 人收藏 0 人点赞
#agent-benchmarks

Anchor:缓解智能体基准生成中的工件漂移

arXiv cs.AI · 2026-05-27 缓存

Anchor是一个任务生成流水线,通过从单一的约束优化规范中联合生成指令、环境、解决方案和验证器,解决了AI智能体基准中的工件漂移问题,为企业工作流提供一致且可审计的评估任务。论文介绍了ERP-Bench——一个包含生产级ERP系统中300个长时任务的基准,结果显示前沿模型在26.1%的试验中满足显式约束,但仅17.4%的试验达到最优解。

0 人收藏 0 人点赞
#agent-benchmarks

关于TASTE:提升智能体基准测试的覆盖度与难度

Hugging Face Daily Papers · 2026-05-27 缓存

TASTE是一种自动化方法,通过自适应对比n-gram建模和迭代难度优化来演化工具序列,从而生成覆盖更广工具使用、更具挑战性的智能体基准测试。生成的τ^c-Bench显示,在现有基准测试中几乎饱和的模型性能大幅下降,表明这是基准饱和而非模型具备稳健能力。

0 人收藏 0 人点赞
#agent-benchmarks

SynAE:一种用于评估工具调用智能体评测中合成数据质量的框架

arXiv cs.CL · 2026-05-22 缓存

SynAE 是一个评估框架,用于衡量工具调用智能体评测中使用的合成数据的质量,从有效性、保真度和多样性等多个维度进行评估。它通过提供指导合成数据生成的指标,应对真实数据不足或敏感带来的挑战。

0 人收藏 0 人点赞
#agent-benchmarks

评估代理型计划-执行流水线中的时序语义缓存与工作流优化

Hugging Face Daily Papers · 2026-05-20 缓存

本文介绍了针对代理型计划-执行流水线的时序语义缓存与MCP工作流优化,在缓存命中时实现了高达30.6倍的加速,并在AssetOpsBench工业基准测试上实现了1.67倍的整体加速。

0 人收藏 0 人点赞
#agent-benchmarks

交互式评估需要设计科学

Hugging Face Daily Papers · 2026-05-18 缓存

本立场论文认为,交互式AI评估应被视为一种设计科学范式,提出了用于通过轨迹评估动态系统行为的双轴分类法和报告标准。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈