R^3-Bench:大型语言模型在共享预算下的资源理性推理面临挑战

Hugging Face Daily Papers 论文

摘要

R^3-Bench 引入了一个基准测试,表明大型语言模型在跨数学、编程和抽象推理等多个推理任务分配共享计算预算时,难以维持性能表现。

在认知科学中,资源理性探讨智能体应如何分配有限的计算资源以实现预期价值最大化。大多数推理和智能体基准测试采用独立的每任务预算;现有的共享预算研究未根据同一模型在单问题场景下的既定能力来校准整个测试套件的表现。我们提出了 R^3-Bench,该基准在数学、竞赛编程和抽象推理领域,在无工具与智能体场景下,评估共享预算约束下的六题套件表现。通过匹配单问题响应曲线,我们在已观察到的成功案例上定义了一个离线经验最优基准。在六个模型对应的72个主表格单元格中,该最优基准在所有单元格的均值均达到或超过竞赛均值,其中71个单元格严格高于竞赛表现。在中等无工具压力下,等额分配的重放策略在六个模型中的四个也超越了竞赛表现。轨迹诊断揭示了策略更新受限以及依赖压力的失败模式。在强智能体压力下的三模型诊断中,至少一个固定调度器在九个单元格中的六个超越了竞赛均值,但没有任何策略在所有领域都占据主导地位。这些结果揭示了模型既定能力与共享预算实际表现之间存在的持续差距。
查看原文
查看缓存全文

缓存时间: 2026/08/18 03:52

论文页面 - R^3-Bench:大语言模型在共享预算下的资源理性推理困境

来源:https://huggingface.co/papers/2608.16033 发布于 8月17日

·

由 https://huggingface.co/CedarWang 提交

PSWang (https://huggingface.co/CedarWang) 发布于 8月18日

摘要

R3-Bench 揭示,共享计算预算导致推理智能体在数学、编程和抽象推理任务中的表现,低于其解决单个问题时的能力。

在认知科学中,资源理性 (resource rationality) (https://huggingface.co/papers?q=resource%20rationality) 探讨智能体应如何分配有限的计算资源以最大化预期价值。大多数推理和智能体基准测试使用每个任务独立的预算;现有的共享预算研究并未将套件性能与同一模型展示的单问题能力进行校准。我们引入了 R^3-Bench,用于评估六个问题套件在共享预算 (https://huggingface.co/papers?q=shared%20budgets) 下的表现,涵盖无工具和智能体设置下的数学、竞争性编程和抽象推理任务。匹配的单问题响应曲线 (https://huggingface.co/papers?q=response%20curves) 基于观察到的成功案例定义了一个离线的经验预言机 (empirical oracle) (https://huggingface.co/papers?q=empirical%20oracle)。在六个模型的 72 个主表格单元格中,预言机均值在所有单元格中匹配或超过竞赛均值,并且在 71 个单元格中严格更高。在中等无工具压力下,等分配重放也对其中四个模型超越了竞赛表现。轨迹诊断揭示了有限的策略更新 (strategy updating) (https://huggingface.co/papers?q=strategy%20updating) 和依赖于压力的失败模式。在一个针对强智能体压力的三个模型诊断中,至少一个固定调度器 (fixed scheduler) (https://huggingface.co/papers?q=fixed%20scheduler) 在九个单元格中的六个超过了竞赛均值,但没有任何策略在所有领域都占优。这些结果揭示了已展示的能力与共享预算实现之间存在的持续差距。

查看 arXiv 页面 (https://arxiv.org/abs/2608.16033) 查看 PDF (https://arxiv.org/pdf/2608.16033) 项目页面 (https://github.com/NineAbyss/R-3-Bench) GitHub2 (https://github.com/NineAbyss/R-3-Bench) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.16033)

引用此论文的模型 0

没有模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2608.16033,可从本页链接至该模型。

引用此论文的数据集 1

R-3-Bench/R-3-Bench Viewer• 更新于约 1 小时前 • 900 • 59 (https://huggingface.co/datasets/R-3-Bench/R-3-Bench)

引用此论文的 Spaces 0

没有 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2608.16033,可从本页链接至该 Space。

包含此论文的合集 0

没有合集包含此论文

将此论文添加到合集 (https://huggingface.co/new-collection) 即可从本页链接至该合集。

相似文章

SciR:用于LLMs科学推理的可控基准

arXiv cs.AI

SciR是一种新的可控基准,用于评估LLMs在科学推理方面的能力,包括演绎、归纳和因果溯因,并通过参数控制提取难度和推理难度。测试表明,两个难度轴都会降低所有模型的性能,推理模型(如DeepSeek-R1)在推理方面优于指令模型。