interactive-benchmarks

标签

Cards List
#interactive-benchmarks

@tomas_hk: 今天我们发布了一种使用交互式基准测试评估模型路由的方法论,该方法更准确地代表了代理成本的累积……

X AI KOLs Timeline ↗ · 2026-09-01 缓存

发布一种通过交互式基准测试评估模型路由的方法论,该方法在领先基准测试中实现了帕累托优势,以更低成本提供更高质量。

0 人收藏 0 人点赞
#interactive-benchmarks

面向LLM Agent澄清请求的不确定性分解

arXiv cs.AI ↗ · 2026-06-20 缓存

本文针对LLM Agent提出了一种基于提示的不确定性分解方法,将行动置信度与请求不确定性分离,使其能在未明确指定的任务中主动寻求澄清。该方法在五个LLM骨干网络上使用新的澄清增强基准进行了评估,显示出显著改进。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈