@di_zhang_fdu:MCP 工具描述正在成为可度量的接口。TDQS 从六个维度为其评分、标出缺陷,并……
摘要
TDQS 从六个维度对 MCP 工具描述进行评分,帮助 Agent 更可靠地选择工具。它提供了 CLI、API 和 Playground 来对定义进行 Lint 检查,在已评分的注册表工具中,97% 被检出至少存在一项缺陷。
查看缓存全文
缓存时间: 2026/09/06 20:52
MCP 工具描述正成为一种可量化的接口。TDQS 从六个维度对其进行评分,标记缺陷,并允许你按选定的等级设置 CI 失败门槛。其注册表显示已有 228,369 个工具完成评分,其中 97% 存在缺陷。https://t.co/cXvCMixuky
TDQS — 工具定义质量评分
来源:https://tdqs.dev/ v1.2 开放规范 (https://tdqs.dev/spec)
评估你的 MCP 工具与智能体的沟通质量。
描述是智能体在选择工具前唯一能读取的信息。TDQS 从六个加权维度对每个定义进行评分,解释每一分的原因,并将结果转换为一个可用于发布门禁的等级——你在终端、CI 以及 Glama 注册表中看到的数字完全一致。
试用 Playground (https://tdqs.dev/playground) npx mcp-tdqs (https://tdqs.dev/cli)
228,369 个工具已在注册表中完成评分 15,036 台 MCP 服务器,每个工具均已评分 73.5% 的工具达到及格线 97% 的描述存在缺陷
工作原理
能确定的地方用确定性规则,必须判断的地方用模型评估。
代码提取 schema 和注解中已有的信息;模型仅对描述中超出这些信息的部分进行评分。流水线的每个阶段都有明确定义,其中确定性阶段的计算结果在不同实现中精确到每一位数字。
- Stage1
上下文信号
确定性代码读取 schema 和注解:参数覆盖率、输出 schema、行为提示、调用成本,以及一个哈希值,确保同一定义每次得分一致。 - Stage2
硬门槛
退化定义——没有描述、将名称重述为句子——会被标记并直接打到最低分,不会浪费模型调用。 - Stage3
评分细则
模型依据已发布的锚点示例,从 1 到 5 对六个维度进行评分,并为每一分提供依据。提示词本身就是规范,逐字节一致。 - Stage4
后处理
代码应用覆盖规则、标记和异味检测,权重通过整数运算汇总,最终得到分数、等级和原因。
等级含义
B 是及格线。
同样的五级阈值适用于单个工具、服务器的描述质量、一致性以及总体评分。以等级作为发布门禁,并阅读评分依据以了解需要修复什么。
- A ≥ 3.5 真正有用的定义
- B ≥ 3.0 及格,达到通过线
- C ≥ 2.0 存在明显不足
- D ≥ 1.0 严重缺失 5
相似文章
PHREEQC-MCQ-200:面向工具增强的科学模拟器代理的诊断基准
介绍了PHREEQC-MCQ-200,这是一个用于评估工具增强的LLM代理在确定性水地球化学模拟中的诊断基准,揭示了模拟器访问提高了准确率,但也导致在没有工具时正确回答的问题出现性能倒退。
ToolSense: 用于审计大语言模型中参数化工具知识的诊断框架
ToolSense 是一个开源诊断框架,能够生成三个基准测试(真实检索、多选题探测、问答探测),用于审计大语言模型的参数化工具知识,揭示了知识-检索分离现象:强大的检索性能可能与较差的事实理解共存。
我评估了36个热门MCP服务器的代理可用性,三分之一得了D或F
一位开发者创建了mcpgrade,这是一个用于评估MCP服务器的评分工具,并发现三分之一的流行服务器在AI代理的文档和可用性方面表现不佳,大多数错误源于缺少参数描述。
DOCSCHISEL:面向LLM智能体的自适应工具文档优化框架
本文研究了工具文档中的信息如何在不同设置下影响LLM智能体的性能,并提出了DocsChisel——一个自适应框架,通过迭代优化工具文档来提高任务成功率。
ChromeDevTools/chrome-devtools-mcp
Chrome DevTools MCP 是一个开源的模型上下文协议服务器,允许 AI 编程助手(Gemini、Claude、Cursor、Copilot)控制并检查实时 Chrome 浏览器,用于自动化、调试和性能分析。它将 Chrome DevTools 与 Puppeteer 集成,为 AI 助手提供完整的浏览器检查和自动化能力。