@di_zhang_fdu:MCP 工具描述正在成为可度量的接口。TDQS 从六个维度为其评分、标出缺陷,并……

X AI KOLs Timeline 工具

摘要

TDQS 从六个维度对 MCP 工具描述进行评分,帮助 Agent 更可靠地选择工具。它提供了 CLI、API 和 Playground 来对定义进行 Lint 检查,在已评分的注册表工具中,97% 被检出至少存在一项缺陷。

MCP 工具描述正在成为可度量的接口。TDQS 从六个维度为其评分、标出缺陷,并支持在低于指定等级时让 CI 失败。其注册表显示,已对 228,369 个工具完成评分,其中 97% 存在缺陷。https://t.co/cXvCMixuky
查看原文
查看缓存全文

缓存时间: 2026/09/06 20:52

MCP 工具描述正成为一种可量化的接口。TDQS 从六个维度对其进行评分,标记缺陷,并允许你按选定的等级设置 CI 失败门槛。其注册表显示已有 228,369 个工具完成评分,其中 97% 存在缺陷。https://t.co/cXvCMixuky


TDQS — 工具定义质量评分

来源:https://tdqs.dev/ v1.2 开放规范 (https://tdqs.dev/spec)

评估你的 MCP 工具与智能体的沟通质量。

描述是智能体在选择工具前唯一能读取的信息。TDQS 从六个加权维度对每个定义进行评分,解释每一分的原因,并将结果转换为一个可用于发布门禁的等级——你在终端、CI 以及 Glama 注册表中看到的数字完全一致。

试用 Playground (https://tdqs.dev/playground) npx mcp-tdqs (https://tdqs.dev/cli)

228,369 个工具已在注册表中完成评分 15,036 台 MCP 服务器,每个工具均已评分 73.5% 的工具达到及格线 97% 的描述存在缺陷

工作原理

能确定的地方用确定性规则,必须判断的地方用模型评估。

代码提取 schema 和注解中已有的信息;模型仅对描述中超出这些信息的部分进行评分。流水线的每个阶段都有明确定义,其中确定性阶段的计算结果在不同实现中精确到每一位数字。

  1. Stage1

    上下文信号

    确定性代码读取 schema 和注解:参数覆盖率、输出 schema、行为提示、调用成本,以及一个哈希值,确保同一定义每次得分一致。
  2. Stage2

    硬门槛

    退化定义——没有描述、将名称重述为句子——会被标记并直接打到最低分,不会浪费模型调用。
  3. Stage3

    评分细则

    模型依据已发布的锚点示例,从 1 到 5 对六个维度进行评分,并为每一分提供依据。提示词本身就是规范,逐字节一致。
  4. Stage4

    后处理

    代码应用覆盖规则、标记和异味检测,权重通过整数运算汇总,最终得到分数、等级和原因。

等级含义

B 是及格线。

同样的五级阈值适用于单个工具、服务器的描述质量、一致性以及总体评分。以等级作为发布门禁,并阅读评分依据以了解需要修复什么。

  1. A ≥ 3.5 真正有用的定义
  2. B ≥ 3.0 及格,达到通过线
  3. C ≥ 2.0 存在明显不足
  4. D ≥ 1.0 严重缺失 5

相似文章

ChromeDevTools/chrome-devtools-mcp

GitHub Trending (daily)

Chrome DevTools MCP 是一个开源的模型上下文协议服务器,允许 AI 编程助手(Gemini、Claude、Cursor、Copilot)控制并检查实时 Chrome 浏览器,用于自动化、调试和性能分析。它将 Chrome DevTools 与 Puppeteer 集成,为 AI 助手提供完整的浏览器检查和自动化能力。