标签
本文提出了一个基于LLMs的对话生成工件修订传播基准,并评估了成本效益测试时计算方法,表明并行采样与选择相结合可提高准确性。
本文介绍了一种针对编程竞赛金牌表现的语言模型后训练专用化流程,通过监督微调和强化学习等技术,在IOI基准测试中取得高分。
本文提出CASE,一种动态选择组合器,使用可解码性准则来预测在大型语言模型中隐藏状态选择何时优于多数投票,从而提高在困难问题上的可靠性。
这篇文章总结了八种基于Google、OpenAI和Anthropic研究的推理时技术,用于改进大语言模型推理,包括权衡和实用注意事项。
论文 'Thought-Level Beam Search for Reasoning' 介绍了 Gambit,这是一种在生成过程中主动重新分配测试时计算资源的方法,通过剪枝低分推理路径并从强前缀分支,并且已被 COLM 2026 接收。
本文介绍了一种考试式评估方法,用于研究推理模型如何在多个问题之间分配共享的测试时计算预算。研究发现,模型无法战略性地分配计算资源,而是按照问题的呈现顺序进行优先级排序,忽略了问题的价值或难度。
观察到与xhigh相比,Claude Opus 5的max thinking在大约20-30%的基准测试中导致性能下降,这与增加测试时计算量可提升性能的预期相反。
探讨一个35B参数模型是否能够通过在测试时扩展其搜索视界来超越1000B模型,使用结构化过程反馈而非蛮力参数扩展。
这篇来自斯坦福、伯克利和NVIDIA的论文提出了LLM-as-a-Verifier,一个利用token logits进行连续评分的通用验证框架。它在包括Terminal-Bench V2(86.5%)和SWE-Bench Verified(78.2%)在内的多个基准上达到了SOTA,并提供了可以加速强化学习训练的细粒度信号。
一个5M参数的模型通过使用连续潜空间测试时计算,在困难逻辑谜题上以极低的推理成本超越了前沿LLM。
关于测试时计算中动态工作流的讨论,包括其有限的用例、对研究实验的好处,以及对更好基准测试的需求。提及了用于智能体编排的模型如Mythos和Opus 4.8。
这篇文章讨论了已确认的研究发现:基于验证器的测试时计算扩展主导无验证器方法,并以Apodex等实际例子展示了分离验证过程带来的收益。它认为构建独立验证器是未来AI能力提升的关键路径。
本文讨论了AI智能体系统中‘循环’的兴起,即智能体持续提示其他智能体执行任务,这被视为超越简单智能体使用的重要一步。Claude Code的Boris Cherny在Meta的@Scale大会上支持这一方法。
本文介绍了 LoopCoder-v2,一个 7B 代码模型,该模型从单次重新思考循环中获益最大;额外的循环会降低性能,挑战了‘更多测试时计算总是有帮助’的假设。
关于AI推理模型的经济性和性能影响的分析,表明启用推理可以将准确率提高10-20%,但消耗的token数量增加5-10倍,并讨论了不同的推理类型及其应用。
深度回顾推理模型从2022年CoT到2024年o1/R1的四年演变,指出真正的分水岭不是推理能力的涌现,而是将推理转化为可计费、可调度的资源。
本文系统研究了推理时计算(token预算、上下文压缩、重复提交)如何影响前沿LLM在具有挑战性的基准上的性能,表明得分是协议相关的,并提倡评估应将能力表示为推理计算的函数。
本文描述了一个脚手架(scaffold),它通过在 Qwen-3.6-27B 和 Gemma-4-31B 上使用迭代修正和分支探索来扩展测试时计算,从而在代码优化方面超越 Claude Mythos。文中附有论文链接和 GitHub 仓库地址。
解读 OpenAI 研究员 Noam Brown 的观点:LLM 的真实能力天花板远高于当前基准测试显示的水平,因为 test-time compute 投入不足,而更强的模型从额外计算中获益更大。这对 AI 安全评估提出了严峻挑战,因为许多危险能力可能只在长时间、高计算预算下才显现。