我们对20个生产代理场景进行了MCP与文件系统访问的基准测试。文件系统设置将LLM成本降低了27%,延迟降低了32%
摘要
一项比较MCP和文件系统访问在20个生产场景中针对AI代理的基准研究发现,文件系统访问将LLM成本降低了27%,延迟降低了32%,同时提高了答案质量。
我们使用两种不同的设置让同一个代理执行20个跨应用任务:官方的Slack、Notion和Linear MCP集成。相同的应用数据使用Locality同步并挂载为文件,这是我参与的项目。我们保持代理框架、模型、提示和机器相同。我们每个场景运行三次,并对结果答案进行了180次盲法随机比较。与MCP相比,文件系统设置:在70%的盲评中产生了更高质量的答案。将LLM成本降低了27%。将延迟降低了32%。减少了61%的工具调用。使用了大约少40%的令牌。跟踪显示,大部分收益来自收集上下文,而不是推理差异。在一个场景中,代理需要通过比较Slack、Linear、Notion和Git仓库中的证据来识别产品发布风险。文件系统代理使用一组并行的rg和文件操作在这些来源中进行搜索。在一个证据收集阶段,这些操作大约耗时0.3秒。MCP代理在相同阶段花费了大约一分钟,进行了21次调用,工具调用时间约为30秒,同时迭代收集上下文。代理在推理上花费了相似的时间。主要区别在于它们如何找到和检查推理所需的证据。我们的结论是,文件系统为代理提供了一个可组合的接口,用于跨来源搜索、过滤和阅读。这使得上下文的发现变得容易,并且可以大规模检索。MCP为它们提供了多个特定应用的接口,这可能会为上下文密集型工作创建更长的检索链。这项基准测试专注于跨应用研究和合成,因此它并未涵盖所有MCP用例。MCP可能仍然是单个操作和轻量级集成的更好接口。完整分析、跟踪和场景级结果链接如下。如果你在生产中运行代理,你是通过工具在运行时获取应用程序上下文,还是预先同步到环境中?你在哪里看到过这种方法失效?
相似文章
基于文件系统的LLM Agent记忆:组织、演化与可持续性
本文首次系统性地探索了基于文件系统的LLM Agent记忆,将管理、搜索和执行Agent的角色规范化,使其围绕一个共享的记忆存储。研究发现,组织主要降低了检索成本,但尚未提升答案质量,并且工具选择对存储形态的影响与模型选择一样大。
MCP-Persona:通过环境模拟对LLM智能体在实际个人应用中的基准测试
MCP-Persona是一种基准测试,用于评估LLM智能体在与个人账户和本地数据库交互的个性化工具上的表现。实验表明,最先进的智能体在个性化工具使用方面面临显著挑战。
到2026年,哪些MCP服务器能让AI代理具备真正的业务能力?
一位实践者分享了他们在业务工作中使用MCP(模型上下文协议)服务器的经验,详细介绍了哪些服务器提供真正的读写能力(例如Postgres MCP、HubSpot MCP、PostFast)以及哪些令人失望(例如Slack MCP、Google Ads MCP),同时强调了主要的安全问题,如OAuth采用率低和漏洞率高。
使用 MCP 进行代码执行:构建更高效的智能体
本文来自 Anthropic,探讨了如何将代码执行与 Model Context Protocol (MCP) 相结合,以提升 AI 智能体的效率。文章分析了工具定义和中间结果导致的 token 过载等挑战,并提出代码执行作为降低延迟和成本的解决方案。
TRACE: 面向LLM代理的开源层次化记忆系统,在MemoryAgentBench的EventQA任务中使用gpt-oss-20B达到82.5% [P]
TRACE是一个面向LLM代理的开源层次化记忆系统,它将对话历史组织成主题树,使用开放权重模型在MemoryAgentBench的EventQA任务上达到了82.5%的F1分数,性能优于Mem0和MemGPT。