对我来说,真正改变看法的指标不是基准测试分数,而是一个答案需要触及多少个应用。
摘要
一位用户描述称,基准测试分数不如AI助手能访问的应用数量重要;他们重点介绍了Runner,这是一款桌面应用,集成了Gmail、Drive和Slack,无需手动复制即可提供上下文。
对我大多数实际任务而言,答案往往分布在三四个应用里。一个简单的“我该怎么回复这个客户”就需要从Gmail、一个Drive文档和一条Slack消息中提取信息,而这些来源都不是我正在输入问题的聊天窗口。我问了ChatGPT和Slack AI同样的问题,两者都给出了架构层面的耸肩:无法访问你的电脑,也无法访问其他应用。这很合理,它们毕竟只在自己的运行环境中。但这导致我成了在标签页之间搬运上下文的信使。真正起到作用的是一个名为Runner的Mac桌面应用,它能够读取Gmail、Drive和Slack,在同一个任务中提供上下文,而不是等我粘贴。它在发送任何内容之前都会询问,这是唯一让我允许它接触真实对话线程的原因。聊天窗口总是能在基准测试中胜出,却在实际工作中败下阵来。
相似文章
基准最大化
讨论了OpenAI市场份额下滑,而Meta和Google却在增长的问题,质疑高基准分数对普通用户是否重要,并提出AI的真正价值在于作为现有产品生态系统中的一项功能。
还有人觉得AI基准测试在预测实际性能方面越来越没用了吗?
本文讨论了AI基准测试高分与实际真实表现之间日益扩大的差距,重点强调了诸如一致性、延迟和上下文处理等问题。
我不再根据这些AI代理在演示中的表现来评判它们,而是开始统计它们帮我关闭了多少未闭合的循环。
作者认为,衡量AI代理实用性的真正标准是它自主关闭了多少未闭合的循环,而不是演示性能或集成数量,并引用Runner作为一个桌面工具,通过跨应用上下文有效关闭这些循环。
@yoheinakajima:刚在我的手机(17 Pro)上运行了这个
RunAnywhere 发布了一款设备端 AI 基准测试应用,可让用户直接在自己的手机上测量模型性能,用实时测试取代发布的数据。
2026年,所有人都在追踪关于AI进步的错误指标。基准测试之战的重要性远不及发生在它们下面一层的事情。
文章认为,在2026年,AI价值的关键区分因素不是模型能力,而是通过像MCP这样的集成协议实现的数据访问,这些协议将模型连接到真实的业务数据(如CRM和会计软件),从而使连接的工作流比基准测试分数更重要。