大多数智能体基准测试并未解决我们真正关心的问题

Reddit r/AI_Agents 新闻

摘要

作者认为,当前的人工智能智能体基准测试忽略了诸如错误处理、人工干预和长期可靠性等实际问题,强调了操作因素对现实世界可信度的重要性。

最近我看了很多智能体基准测试,总是遇到同一个问题。基准测试可以告诉我一个系统在特定任务上比另一个得分高,但它没有告诉我太多关于在现实世界中运行这个系统的情况。我最终关心的通常是操作性问题。当出错时会发生什么?人工干预的频率如何?理解智能体为什么做出某个决策是否容易?它在运行数周后是否还能保持可靠?我见过一些不是基准测试领跑者的智能体,但它们更容易信任,因为它们的行为可预测且易于操作。也许这就是为什么我觉得基准测试结果不如以前那么有用。当你评估智能体时,什么信号对你来说最重要?
查看原文

相似文章

我认为很多人低估了不可靠 Agent 的成本有多高

Reddit r/AI_Agents

作者指出,不可靠 AI Agent 的隐性成本在于持续人工监控所带来的认知开销,并强调在实际落地中,可预测性与环境稳定性远比模型的原始智能更重要。当 Agent 运行在受控且经过验证的环境中,而非充满不确定性的环境时,实际工作流的效率将得到显著提升。

基准测试未衡量的:论自主智能体弃权能力的评估

arXiv cs.AI

本文认为,目前的自主智能体基准测试未能评估智能体是否应该继续执行任务,从而引入了'合规偏见'。作者提出了一个需要弃权的场景分类法,以及新的评估协议(Safety Rate, Usability Rate, Informed Refusal Rate),初步结果显示,不同模型家族的安全性与可用性之间存在可调节的权衡。