test-time-compute

标签

Cards List
#test-time-compute

还有何待修复?探索对话生成工件中修订传播的成本效益测试时计算

arXiv cs.CL · 2天前 缓存

本文提出了一个基于LLMs的对话生成工件修订传播基准,并评估了成本效益测试时计算方法,表明并行采样与选择相结合可提高准确性。

0 人收藏 0 人点赞
#test-time-compute

后训练语言模型在编程竞赛中实现金牌级表现

Hugging Face Daily Papers · 4天前 缓存

本文介绍了一种针对编程竞赛金牌表现的语言模型后训练专用化流程,通过监督微调和强化学习等技术,在IOI基准测试中取得高分。

0 人收藏 0 人点赞
#test-time-compute

一个可解码性准则预测在大型语言模型中隐藏状态选择何时优于多数投票

arXiv cs.AI · 2026-08-19 缓存

本文提出CASE,一种动态选择组合器,使用可解码性准则来预测在大型语言模型中隐藏状态选择何时优于多数投票,从而提高在困难问题上的可靠性。

0 人收藏 0 人点赞
#test-time-compute

@_avichawla: https://x.com/_avichawla/status/2088536550552605174

X AI KOLs Following · 2026-08-15 缓存

这篇文章总结了八种基于Google、OpenAI和Anthropic研究的推理时技术,用于改进大语言模型推理,包括权衡和实用注意事项。

0 人收藏 0 人点赞
#test-time-compute

@LijieyYang: 非常高兴地分享,我们的论文 “Thought-Level Beam Search for Reasoning” 已被 COLM 2026 接收!不同 …

X AI KOLs Following · 2026-08-14 缓存

论文 'Thought-Level Beam Search for Reasoning' 介绍了 Gambit,这是一种在生成过程中主动重新分配测试时计算资源的方法,通过剪枝低分推理路径并从强前缀分支,并且已被 COLM 2026 接收。

0 人收藏 0 人点赞
#test-time-compute

用力思考而非聪明思考:推理模型未能在问题间合理分配测试时计算

arXiv cs.CL · 2026-08-11 缓存

本文介绍了一种考试式评估方法,用于研究推理模型如何在多个问题之间分配共享的测试时计算预算。研究发现,模型无法战略性地分配计算资源,而是按照问题的呈现顺序进行优先级排序,忽略了问题的价值或难度。

0 人收藏 0 人点赞
#test-time-compute

@jerryjliu0: 我从博客/系统卡中观察到一件有趣的事情:在相当一部分报告的基准测试中(大约20-30%……

X AI KOLs Following · 2026-07-24 缓存

观察到与xhigh相比,Claude Opus 5的max thinking在大约20-30%的基准测试中导致性能下降,这与增加测试时计算量可提升性能的预期相反。

0 人收藏 0 人点赞
#test-time-compute

@che_shr_cat: 1/ 参数规模是一种蛮力拐杖。如果一个35B模型仅通过扩展其搜索…就能击败1,000B模型呢?

X AI KOLs Timeline · 2026-07-19 缓存

探讨一个35B参数模型是否能够通过在测试时扩展其搜索视界来超越1000B模型,使用结构化过程反馈而非蛮力参数扩展。

0 人收藏 0 人点赞
#test-time-compute

@gurtej__gill_: 来自斯坦福、伯克利和NVIDIA的这篇新论文感觉像是测试时计算拼图中至关重要的一块……

X AI KOLs Timeline · 2026-07-07 缓存

这篇来自斯坦福、伯克利和NVIDIA的论文提出了LLM-as-a-Verifier,一个利用token logits进行连续评分的通用验证框架。它在包括Terminal-Bench V2(86.5%)和SWE-Bench Verified(78.2%)在内的多个基准上达到了SOTA,并提供了可以加速强化学习训练的细粒度信号。

0 人收藏 0 人点赞
#test-time-compute

测试时计算是否触及天花板?

Reddit r/AI_Agents · 2026-07-04

本文探讨了AI模型在测试时计算扩展带来的收益是否正在减弱,这可能表明当前扩展范式正面临上限。

0 人收藏 0 人点赞
#test-time-compute

@che_shr_cat: 1/ 一个5M参数的模型刚刚在困难逻辑谜题上击败了前沿LLM,推理成本不到其十万分之一。…

X AI KOLs Timeline · 2026-06-29 缓存

一个5M参数的模型通过使用连续潜空间测试时计算,在困难逻辑谜题上以极低的推理成本超越了前沿LLM。

0 人收藏 0 人点赞
#test-time-compute

@omarsar0: 刚刚就动态工作流进行了精彩的讨论。粗略笔记:- 适用于极少数用例 - 将其视为…

X AI KOLs Following · 2026-06-25 缓存

关于测试时计算中动态工作流的讨论,包括其有限的用例、对研究实验的好处,以及对更好基准测试的需求。提及了用于智能体编排的模型如Mythos和Opus 4.8。

0 人收藏 0 人点赞
#test-time-compute

基于验证器与无验证器的测试时扩展结果比人们认为的更早,并且它不断得到确认 [D]

Reddit r/MachineLearning · 2026-06-24

这篇文章讨论了已确认的研究发现:基于验证器的测试时计算扩展主导无验证器方法,并以Apodex等实际例子展示了分离验证过程带来的收益。它认为构建独立验证器是未来AI能力提升的关键路径。

0 人收藏 0 人点赞
#test-time-compute

AI世界正在变得‘循环’

TechCrunch AI · 2026-06-22 缓存

本文讨论了AI智能体系统中‘循环’的兴起,即智能体持续提示其他智能体执行任务,这被视为超越简单智能体使用的重要一步。Claude Code的Boris Cherny在Meta的@Scale大会上支持这一方法。

0 人收藏 0 人点赞
#test-time-compute

@rohanpaul_ai: 这篇论文提出了一个大胆的主张,对‘更多测试时计算应持续带来帮助’的普遍观点提出了挑战。声称一个代码…

X AI KOLs Following · 2026-06-18 缓存

本文介绍了 LoopCoder-v2,一个 7B 代码模型,该模型从单次重新思考循环中获益最大;额外的循环会降低性能,挑战了‘更多测试时计算总是有帮助’的假设。

0 人收藏 0 人点赞
#test-time-compute

@cerebras: https://x.com/cerebras/status/2067357992929153268

X AI KOLs Timeline · 2026-06-17 缓存

关于AI推理模型的经济性和性能影响的分析,表明启用推理可以将准确率提高10-20%,但消耗的token数量增加5-10倍,并讨论了不同的推理类型及其应用。

0 人收藏 0 人点赞
#test-time-compute

@grapeot: 推理模型不是 2024 年的石破天惊。 很多人第一次看到 o1「思考」十几秒再答题,会觉得模型一夜之间学会了推理。但把时间线拉长,从 CoT prompting(2022)到 o1,中间走了整整四年。 三件被混在一起的事: 1. 推理能力…

X AI KOLs Timeline · 2026-06-17 缓存

深度回顾推理模型从2022年CoT到2024年o1/R1的四年演变,指出真正的分水岭不是推理能力的涌现,而是将推理转化为可计费、可调度的资源。

0 人收藏 0 人点赞
#test-time-compute

推理计算如何影响前沿LLM的评估

arXiv cs.AI · 2026-06-17 缓存

本文系统研究了推理时计算(token预算、上下文压缩、重复提交)如何影响前沿LLM在具有挑战性的基准上的性能,表明得分是协议相关的,并提倡评估应将能力表示为推理计算的函数。

0 人收藏 0 人点赞
#test-time-compute

我将测试时计算扩展到 Qwen-3.6-27B 和 Gemma-4-31B,以在代码优化和加速方面超越 Claude Mythos。

Reddit r/LocalLLaMA · 2026-06-12

本文描述了一个脚手架(scaffold),它通过在 Qwen-3.6-27B 和 Gemma-4-31B 上使用迭代修正和分支探索来扩展测试时计算,从而在代码优化方面超越 Claude Mythos。文中附有论文链接和 GitHub 仓库地址。

0 人收藏 0 人点赞
#test-time-compute

@Phoenixyin13: 认真读完了OpenAI 研究员 Noam Brown 今天的长帖,一个被行业严重低估的现实。 LLM 的真实能力天花板,远高于当前任何 benchmark 所显示的水平。 原因,是给它的test-time compute太少了。而随着模型…

X AI KOLs Timeline · 2026-06-09 缓存

解读 OpenAI 研究员 Noam Brown 的观点:LLM 的真实能力天花板远高于当前基准测试显示的水平,因为 test-time compute 投入不足,而更强的模型从额外计算中获益更大。这对 AI 安全评估提出了严峻挑战,因为许多危险能力可能只在长时间、高计算预算下才显现。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈