test-time-compute

标签

Cards List
#test-time-compute

@polynoamial: https://x.com/polynoamial/status/2064210146558136827

X AI KOLs Following · 2026-06-09 缓存

本文认为,LLM基准测试性能越来越依赖于测试时的计算量,而当前的评估方法在控制推理预算时无法捕捉到能力的提升。它主张绘制性能与token数、成本或时间的关系图,并讨论了对安全评估的影响。

0 人收藏 0 人点赞
#test-time-compute

并非所有错误都相同:基于后果感知的推理计算资源分配

arXiv cs.AI · 2026-06-04 缓存

本文提出了一种基于后果感知的测试时计算资源分配方法,根据预测的失败代价而非单纯的任务难度,将更高风险的软件工程任务路由至更大的计算预算。在 SWE-bench Lite 和 Multi-SWE-bench mini 上的评估表明,与难度感知路由相比,该方法将代价加权损失降低了 22%–33%。

0 人收藏 0 人点赞
#test-time-compute

Thinking Past the Answer: Evaluating Harmful Overthinking in Large Reasoning Models

arXiv cs.AI · 2026-06-03 缓存

This paper introduces a prefix-level trajectory evaluation protocol to distinguish harmful overthinking from verbose but harmless overthinking in large reasoning models, showing that continued reasoning after reaching the correct answer can destabilize performance. The authors find that early stopping improves accuracy by up to 21% on multimodal benchmarks, and identify logical drift and visual reinterpretation as key causes of correctness deviations.

0 人收藏 0 人点赞
#test-time-compute

FineVerify:通过细粒度自我验证扩展智能搜索的测试时计算

Hugging Face Daily Papers · 2026-05-30 缓存

FineVerify是一个针对智能搜索的自我验证框架,它将问题分解为子问题,验证采样候选,并选择最佳候选,在多个基准测试上取得了相对于基线的显著准确率提升,包括使GPT-5-mini在BrowseComp-Plus上超越GPT-5。

0 人收藏 0 人点赞
#test-time-compute

@FrancoisChauba1: 如果你在(未排序列表、冒泡排序过程、已排序列表)的轨迹上进行训练,你永远无法通过测试时计算(TTC)达到…

X AI KOLs Following · 2026-05-26 缓存

一篇批评文章指出,在人类生成的数据上训练LLM限制了它们通过测试时计算发现新颖解决方案的能力,而真正的AGI需要模型能够像AlphaZero那样更广泛地探索假设空间。

0 人收藏 0 人点赞
#test-time-compute

@askalphaxiv: 由Yoshua Bengio指导的一篇精彩论文 "Generative Recursive Reasoning" 测试时计算不仅应…

X AI KOLs Timeline · 2026-05-21 缓存

论文《Generative Recursive Reasoning》提出了一种方法,通过并行采样多个潜在推理轨迹来扩展测试时计算,使模型能够探索多样化的假设并避免确定性坍缩。该方法在数独、ARC AGI、N皇后和图形着色等任务上提升了性能,还可以从头生成有效的数独棋盘和MNIST数字。

0 人收藏 0 人点赞
#test-time-compute

Equilibrium Reasoners: 学习吸引子实现可扩展推理

Hugging Face Daily Papers · 2026-05-20 缓存

Equilibrium Reasoners (EqR) 提出了一种新颖的可扩展推理框架,通过在潜在动态系统中学习任务条件吸引子,展开多达 40,000 层,在 Sudoku-Extreme 上实现了超过 99% 的准确率。

0 人收藏 0 人点赞
#test-time-compute

GridProbe:针对长视频 VLM 自适应推理时计算的后验探测方法

Hugging Face Daily Papers · 2026-05-11 缓存

GridProbe 是一种无需训练的长视频 VLM 推理范式,它通过后验探测自适应地选择相关帧,在几乎不损失准确率的情况下实现了低于二次方的注意力计算成本。

0 人收藏 0 人点赞
#test-time-compute

ZAYA1-8B 技术报告

arXiv cs.AI · 2026-05-08 缓存

本报告介绍了 ZAYA1-8B,这是一款在 AMD 硬件上训练的混合专家推理模型,使用少于 10 亿的激活参数在数学和编程基准测试中取得了具有竞争力的性能。报告还详细介绍了马尔可夫式 RSA(Markovian RSA),这是一种用于聚合并行推理轨迹的新型测试时计算(test-time compute)方法。

0 人收藏 1 人点赞
#test-time-compute

@gnotuy:我们开源了 Kimi K2.6,测试时计算的下一个前沿不是更大的模型,而是更优的智能组织……

X AI KOLs Following · 2026-04-20 缓存

Moonshot AI 开源 Kimi K2.6,并指出测试时计算的下一个前沿在于更优的智能组织,而非单纯堆砌更大的模型。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈