Relay-Bench:评估LLMs在多领域推理链上的表现
摘要
Relay-Bench是一个新的基准测试,旨在评估大型语言模型在需要跨多个领域知识的推理链上的表现。
查看缓存全文
缓存时间: 2026/07/22 08:23
# Relay-Bench:评估LLM在多领域推理链上的表现 来源:https://arxiv.org/abs/2607.18438 书目工具 ## 书目与引用工具 书目探索器 切换 代码、数据、媒体 ## 本文相关的代码、数据与媒体 演示 ## 演示 相关论文 ## 推荐与搜索工具 关于 arXivLabs ## arXivLabs:与社区合作者的实验项目 arXivLabs 是一个框架,允许合作者直接在我们的网站上开发和分享新的 arXiv 功能。 与 arXivLabs 合作的个人和组织都已接受并认可我们关于开放性、社区、卓越和用户数据隐私的价值观。arXiv 致力于这些价值观,并且只与遵守这些价值观的伙伴合作。 有一个能为 arXiv 社区增值的项目想法吗?**了解更多关于 arXivLabs** (https://info.arxiv.org/labs/index.html)。
相似文章
ChaosBench-Logic v2:大规模评估LLM在动态系统上的逻辑推理能力
ChaosBench-Logic v2是一个包含165个动态系统共40,886个问题的大规模基准测试,用于评估LLM的逻辑推理能力,结果显示即使在最前沿的模型中,在状态转变推理上也接近随机表现,并存在系统性失败模式。
大型语言模型中的交互推理评估:基于可执行游戏的分层基准
本文介绍了一个用于推理评估的多轮交互框架,其中大型语言模型需要查询隐藏环境并整合部分观察结果。该框架实例化为一个包含474个可执行游戏、跨五个难度级别的基准,展示了区分能力并揭示了推理差异。
From Reasoning Depth to Reasoning Breadth: Evaluating Multi-Point Associative Reasoning in Large Language Models
This paper introduces MPAR-Bench, a bilingual benchmark for evaluating multi-point associative reasoning in large language models, along with a perturbation suite and coarse-to-fine evaluation protocol. Results show that deeper reasoning does not automatically confer robust reasoning breadth.
Complexity Ceiling Benchmark:深度缩放下的多领域顺序推理评估
介绍复杂度天花板基准(CCB),该基准评估LLM推理能力随顺序步骤增加而衰减的情况,涵盖三个领域。研究发现一致的每步几何衰减,并且所有模型在传递性社会逻辑中在5步内崩溃,即使整体准确性很高。
@burny_tech: 隐式推理综述 "大型语言模型(LLMs)展现了令人印象深刻的推理能力,尤其是……
本综述全面概述了LLM中的隐式推理,探讨了在连续隐藏状态中执行多步推理且无需显式token级监督的方法。