R^3-Bench:大型语言模型在共享预算下的资源理性推理面临挑战
摘要
R^3-Bench 引入了一个基准测试,表明大型语言模型在跨数学、编程和抽象推理等多个推理任务分配共享计算预算时,难以维持性能表现。
查看缓存全文
缓存时间: 2026/08/18 03:52
论文页面 - R^3-Bench:大语言模型在共享预算下的资源理性推理困境
来源:https://huggingface.co/papers/2608.16033 发布于 8月17日
·
由 https://huggingface.co/CedarWang 提交
PSWang (https://huggingface.co/CedarWang) 发布于 8月18日
摘要
R3-Bench 揭示,共享计算预算导致推理智能体在数学、编程和抽象推理任务中的表现,低于其解决单个问题时的能力。
在认知科学中,资源理性 (resource rationality) (https://huggingface.co/papers?q=resource%20rationality) 探讨智能体应如何分配有限的计算资源以最大化预期价值。大多数推理和智能体基准测试使用每个任务独立的预算;现有的共享预算研究并未将套件性能与同一模型展示的单问题能力进行校准。我们引入了 R^3-Bench,用于评估六个问题套件在共享预算 (https://huggingface.co/papers?q=shared%20budgets) 下的表现,涵盖无工具和智能体设置下的数学、竞争性编程和抽象推理任务。匹配的单问题响应曲线 (https://huggingface.co/papers?q=response%20curves) 基于观察到的成功案例定义了一个离线的经验预言机 (empirical oracle) (https://huggingface.co/papers?q=empirical%20oracle)。在六个模型的 72 个主表格单元格中,预言机均值在所有单元格中匹配或超过竞赛均值,并且在 71 个单元格中严格更高。在中等无工具压力下,等分配重放也对其中四个模型超越了竞赛表现。轨迹诊断揭示了有限的策略更新 (strategy updating) (https://huggingface.co/papers?q=strategy%20updating) 和依赖于压力的失败模式。在一个针对强智能体压力的三个模型诊断中,至少一个固定调度器 (fixed scheduler) (https://huggingface.co/papers?q=fixed%20scheduler) 在九个单元格中的六个超过了竞赛均值,但没有任何策略在所有领域都占优。这些结果揭示了已展示的能力与共享预算实现之间存在的持续差距。
查看 arXiv 页面 (https://arxiv.org/abs/2608.16033) 查看 PDF (https://arxiv.org/pdf/2608.16033) 项目页面 (https://github.com/NineAbyss/R-3-Bench) GitHub2 (https://github.com/NineAbyss/R-3-Bench) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.16033)
引用此论文的模型 0
没有模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2608.16033,可从本页链接至该模型。
引用此论文的数据集 1
R-3-Bench/R-3-Bench Viewer• 更新于约 1 小时前 • 900 • 59 (https://huggingface.co/datasets/R-3-Bench/R-3-Bench)
引用此论文的 Spaces 0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2608.16033,可从本页链接至该 Space。
包含此论文的合集 0
没有合集包含此论文
将此论文添加到合集 (https://huggingface.co/new-collection) 即可从本页链接至该合集。
相似文章
推理的影子价格:LLM最优预算分配的经济学视角
本文将LLM推理预算分配形式化为一个约束优化问题,提出CLEAR方法,将资源从低效用查询重新分配到接近涌现阈值的查询,在预算紧张的情况下实现了高达3倍的准确率提升。
A2RBench:一种自动化的可形式化验证抽象推理基准生成范式
本文介绍了A2RBench,一个用于为LLM生成可形式化验证的抽象推理基准的自动化流水线,它利用循环一致性来确保唯一解,并揭示当前LLM在3D推理任务上显著落后于人类。
LinAlg-Bench:揭示大语言模型数学推理中结构性失败模式的诊断性基准
介绍了LinAlg-Bench,这是一个诊断性基准,用于评估10个前沿大语言模型在矩阵维度上的结构化线性代数计算,揭示了大语言模型的数学失败在结构上受到约束,并在4x4规模下从执行错误过渡到计算放弃。
SciR:用于LLMs科学推理的可控基准
SciR是一种新的可控基准,用于评估LLMs在科学推理方面的能力,包括演绎、归纳和因果溯因,并通过参数控制提取难度和推理难度。测试表明,两个难度轴都会降低所有模型的性能,推理模型(如DeepSeek-R1)在推理方面优于指令模型。
用力思考而非聪明思考:推理模型未能在问题间合理分配测试时计算
本文介绍了一种考试式评估方法,用于研究推理模型如何在多个问题之间分配共享的测试时计算预算。研究发现,模型无法战略性地分配计算资源,而是按照问题的呈现顺序进行优先级排序,忽略了问题的价值或难度。