@ms_aifrontiers: SentinelBench 在时间演变的网络环境中测试智能体,成功需要等待。等待的方式至关重要:在4…
摘要
SentinelBench 是一个新的基准测试,用于评估 AI 智能体在时间演变的网络环境中的表现。研究发现,使用专用变化检测工具的智能体优于使用睡眠-轮询循环的智能体,成本降低 9.7 倍。
SentinelBench 在时间演变的网络环境中测试智能体,成功需要等待。等待的方式至关重要:在 40 分钟的任务中,使用睡眠-轮询循环的智能体成本可能高出 9.7 倍,同时完成任务的数量少于使用专用变化检测工具的智能体。
相似文章
@ms_aifrontiers: 许多智能体基准测试假设世界仅在智能体行动时才发生变化。许多实际任务并非如此:门票开售…
讨论当前智能体基准测试的一个局限性,即它们假设世界仅在智能体行动时才发生变化,而许多实际任务要求智能体等待外部事件发生后再行动。
@ms_aifrontiers: 在每个检查点上运行所有基准测试既慢又昂贵。微软AI前沿团队的新工作提出了一个问题:你是否……
微软AI前沿团队推出了BenchPress,一种无需运行实际基准测试即可预测基准分数的方法,节省时间和计算资源。
HealthAgentBench: 面向前沿AI智能体的统一真实医疗智能体环境基准套件
本文介绍了HealthAgentBench,一个包含54个真实医疗任务的套件,用于评估前沿AI智能体。研究发现,即使是最强的智能体(Codex GPT-5.5)也仅能达到约42%的成功率,凸显了巨大的改进空间。
DSAgentBench:智能体能否在真实计算机环境中自动化端到端数据科学工作流?
本文介绍了DSAgentBench,这是首个在真实计算机环境中评估自主智能体完成完整、多工具数据科学工作流的基准。结果表明,即使最强的智能体(Claude-4.6-Sonnet)的任务成功率也仅为56.70%,而开源智能体仍低于1%,揭示了巨大的能力差距。
@OkhayIea: 每个人都在竞相构建“AI科学家”。因此我们提出了一个直白的问题:当今最好的编码代理能打败公开发表的…
介绍了NatureBench,这是一个跨学科基准测试,包含来自Nature论文的90个任务,用于测试AI编码代理。研究发现,最好的代理(Claude Opus 4.7)仅在17.8%的任务上超越了现有最佳水平,而且其成功往往是通过将科学简化为监督式机器学习,而非真正的发现来实现的。