Relay-Bench:评估LLMs在多领域推理链上的表现

arXiv cs.CL 论文

摘要

Relay-Bench是一个新的基准测试,旨在评估大型语言模型在需要跨多个领域知识的推理链上的表现。

arXiv:2607.18438v1 公告类型:新 摘要:介绍Relay-Bench,一个未饱和的、全面的、纯文本基准测试,用于衡量LLMs在单次提示中完成来自不同领域的各种任务的能力。领先模型GPT-5.5 (xHigh)得分为43.3%。测试集完全由复合问题组成:多个单一领域的子问题组合成挑战,需要结合多个领域进行推理。许多问题还通过提示编码和有意上下文膨胀增加了复杂性。测试领域包括视觉推理、编程、数学、信息提取(重点关注网络搜索)、问题解决、通用知识和数据分析。模型框架之外没有施加任何限制,明确鼓励模型利用代码执行、网络搜索和所有可用工具。所有问题由两到十三个子问题组成,不需要多模态输入或输出。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:23

# Relay-Bench:评估LLM在多领域推理链上的表现
来源:https://arxiv.org/abs/2607.18438
书目工具

## 书目与引用工具

书目探索器 切换

代码、数据、媒体

## 本文相关的代码、数据与媒体

演示

## 演示

相关论文

## 推荐与搜索工具

关于 arXivLabs

## arXivLabs:与社区合作者的实验项目

arXivLabs 是一个框架,允许合作者直接在我们的网站上开发和分享新的 arXiv 功能。

与 arXivLabs 合作的个人和组织都已接受并认可我们关于开放性、社区、卓越和用户数据隐私的价值观。arXiv 致力于这些价值观,并且只与遵守这些价值观的伙伴合作。

有一个能为 arXiv 社区增值的项目想法吗?**了解更多关于 arXivLabs** (https://info.arxiv.org/labs/index.html)。

相似文章