对我来说,真正改变看法的指标不是基准测试分数,而是一个答案需要触及多少个应用。

Reddit r/artificial 产品

摘要

一位用户描述称,基准测试分数不如AI助手能访问的应用数量重要;他们重点介绍了Runner,这是一款桌面应用,集成了Gmail、Drive和Slack,无需手动复制即可提供上下文。

对我大多数实际任务而言,答案往往分布在三四个应用里。一个简单的“我该怎么回复这个客户”就需要从Gmail、一个Drive文档和一条Slack消息中提取信息,而这些来源都不是我正在输入问题的聊天窗口。我问了ChatGPT和Slack AI同样的问题,两者都给出了架构层面的耸肩:无法访问你的电脑,也无法访问其他应用。这很合理,它们毕竟只在自己的运行环境中。但这导致我成了在标签页之间搬运上下文的信使。真正起到作用的是一个名为Runner的Mac桌面应用,它能够读取Gmail、Drive和Slack,在同一个任务中提供上下文,而不是等我粘贴。它在发送任何内容之前都会询问,这是唯一让我允许它接触真实对话线程的原因。聊天窗口总是能在基准测试中胜出,却在实际工作中败下阵来。
查看原文

相似文章

基准最大化

Reddit r/ArtificialInteligence

讨论了OpenAI市场份额下滑,而Meta和Google却在增长的问题,质疑高基准分数对普通用户是否重要,并提出AI的真正价值在于作为现有产品生态系统中的一项功能。