@Greptime: 评估查询接口与RCA模型。在Agent RCA Bench中,六个模型调查了相同的14个事件……
摘要
Agent RCA Bench评估发现,GreptimeDB的SQL/PromQL接口相比Prometheus/Loki/Tempo包装器,产生了40%更少的错误诊断,并使用了约48%更少的输入令牌,跨六个AI模型。
查看缓存全文
缓存时间: 2026/09/14 21:36
评估查询接口及根因分析模型
在Agent RCA Bench测试中,六款模型对14个故障案例进行了根因分析。在每种接口168次运行中,GreptimeDB的SQL/PromQL接口产生的错误诊断减少了40%,输入token消耗减少了约48%。
这些结果涵盖了存储、查询语言和工具设计的完整组合。
交互式报告:https://rca-bench.greptime.com 完整报告:https://greptime.com/blogs/2026-09-08-agent-rca-bench-interface-semantic-layer…
用单一数据库替代Prometheus、Loki和Tempo——Agent RCA Bench
来源:https://rca-bench.greptime.com/
研究发现
- 单一数据库在准确率、token消耗和成本方面均优于三套后端[已验证]
- 正确诊断数量:168次运行中完成130次 vs 三套后端的105次
- 输入token消耗:199,823,586 vs 381,843,662
- 全部6款模型在GreptimeDB上读取的token更少;各案例中位数降幅在14%至77%之间
- 5款有完整成本估算的模型在GreptimeDB上的花费均低于三套后端;gemini-3.8-flash因缺乏完整成本估算未参与比较
- 3个预设终点通过Holm校正,均支持GreptimeDB(claude-fable-5-1、gemini-3.8-flash和qwen3.8-max-0902)
- 针对服务与依赖故障,语义图接口准确率最高[描述性结论]
- 服务与依赖故障:语义层辅助下112/120,无语义层时106/120,三套后端仅85/120
- 没有模型在语义层辅助下对此类故障的诊断正确数减少;6款中有4款表现提升
- 在语义层读取行数更少的检索场景中,发现层(35/35)和图检索层(11/12)均完成有效检索
- 所有模型在GreptimeDB上读取的token均更少,其中5款准确率更高[描述性结论]
- 全部6款模型在GreptimeDB上token消耗更少
- 5款模型在GreptimeDB上产生了更多正确诊断
- 5款模型在GreptimeDB上用更少的工具调用达到了正确诊断
三种接口对比
- 分离接口:遥测数据、Prometheus原生HTTP API、Loki原生HTTP API、Tempo原生HTTP API
- 原始接口:遥测数据、常规架构元数据、只读SQL、无指标元数据的PromQL
- 图谱接口:遥测数据、常规架构元数据、只读SQL、完整PromQL、表语义、语义实体、语义关系、使用指导、运行时恢复指导、覆盖快照
各接口正确诊断数
- gpt-5.6-sol:分离接口 13/28,原始接口 22/28,图谱接口 20/28
- deepseek-v4-pro:分离接口 13/28,原始接口 18/28,图谱接口 18/28
- claude-fable-5-1:分离接口 27/28,原始接口 26/28,图谱接口 23/28
- glm-5.3:分离接口 10/28,原始接口 14/28,图谱接口 16/28
- gemini-3.8-flash:分离接口 22/28,原始接口 25/28,图谱接口 24/28
- qwen3.8-max-0902:分离接口 20/28,原始接口 25/28,图谱接口 23/28
端到端成本估算
- 分离接口:183.95–187.39美元
- 原始接口:98.37–100.50美元
- 图谱接口:106.88–108.97美元
(全部6款模型的端到端成本估算;区间值反映缓存明细缺失的影响)
预设问题分析
- 存储模式:部分支持。12个预设终点中有3个通过Holm校正;在固定模型分组(m=8、m=4)内校正,未合并全部12个终点
- 语义层:未支持。12个预设终点均未通过Holm校正;在固定模型分组内校正
- 模型排名:描述性结论。作为描述性排序报告,未声称统计显著性
在图谱接口运行中,168次运行均成功调用query_semantic_graph,共执行369次调用。两种GreptimeDB接口在92次运行中发起192次成功SQL JOIN调用,其中仅3次跨信号类型连接(涉及3次运行)。PromQL评估在336次GreptimeDB运行中成功22次,在168次三套后端运行中成功160次。
总计完成696次运行,涵盖6款模型、14个端到端案例和8个微案例。完整叙述报告见REPORT.md(https://github.com/GreptimeTeam/agent-rca-bench/blob/main/REPORT.md)。
数据更新于2026-09-08T03:50:20Z;报告生成于2026-09-08T04:51:03Z。
5次运行使用了超过冻结值的供应商并发限制;逐次运行记录保存在JSON文件中。本次测量未单独分析该变化的影响。
数据修正:重新执行并替换168个分离接口单元,保留336个原始/图谱接口单元及全部微案例结果。重跑修正了Tempo保留时间与查询结果中的重复标签名称问题。分离接口的max_items参数沿用原始SQL max_rows建议,返回单位改为items;工具主描述未添加聚合建议。原始/图谱接口的query_metrics参数描述保持不变。每次替换调查前后均通过trace可见性与样本完整性检查,单元级门控记录与结果哈希保存在JSON中。原始/图谱接口保留原始PromQL编码且运行时间不同,本次比较未隔离供应商时间效应或各项修正的影响。后续用户授权允许对临时连接/供应商错误进行重试(每单元最多3次,总尝试4次),并保存所有失败记录;错误诊断与预算耗尽案例未重跑。3个单元因SDK连接错误执行6次重试,额外观测费用28.9673美元;最终替换单元费用已计入调查成本。未返回用量的请求可能存在未观测账单费用。JSON保留授权信息、执行修订、脱敏尝试记录及来源哈希。输出受限的失败案例保留未重跑(gemini-3.8-flash / semantic-rca-transfer-014 / rep0),按冻结运行器契约计为失败并保留runner error标记。固定查询与轨迹后,使用o200k_base分词并基于模型系数校准,重复标签开销估算为原始接口保留输入的0.71%、图谱接口保留输入的0.21%。此为离线估算,非供应商新测量数据,也不影响诊断准确率。保留该开销使GreptimeDB显得更耗token;扣除后,分离接口与原始接口的总输入差距扩大约0.8%。Gemini请求(含SDK重试)共享每分钟1,800,000输入token的本地配额,发送前估算、响应后校正实际用量;耗时包含配额等待时间。
相似文章
根因分析在真实遥测数据上能走多远?
本文利用OpenRCA基准研究了真实遥测数据上的根因分析,表明现有的经典方法和基于LLM的方法均失败,并提出了一种结构化多智能体RCA流水线,其性能大幅优于现有方法。进一步通过逆向推理揭示,主要瓶颈在于推理能力而非数据访问,并引入了自动化规则挖掘以减少对人工领域知识的依赖。
LongRCA Bench: 诊断长时程智能体失败中的责任角色和根本原因
LongRCA Bench 引入了一个用于诊断长时程智能体轨迹失败的基准,RCTA方法改进了责任角色和根本原因步骤的归因。
你实际在生产环境中运行的是哪个推理模型?
一位从业者寻求关于 o3、Claude extended thinking、Gemini 2.5 Pro 和 Ring 2.6 1T 等推理模型在生产环境中的代理任务上的真实反馈,质疑 Ring 的双推理强度模式在实际表现与基准测试之间的差异。
临床AI工具在真实临床即时查询中的专家评估
本文报告了一项针对临床AI工具的盲评,采用医生在临床即时提出的真实查询,比较了专用模型与通用模型在五个维度上的表现。专用工具(OpenEvidence)在所有维度上均优于通用模型,作者同时发布了Real-POCQi基准测试集。
仅靠基准测试不够:RAMP——生产系统中代理模型的运行时评估
RAMP是一个基于生产环境的LLM代理评估框架,可揭示静态基准测试无法察觉的显著能力退化,显示任务完成率在串行工作流中从100%骤降至20%。该框架在真实的编译器构建工作负载上评估了15个主流模型,涉及复杂的工具链交互和分阶段恢复机制。