test-time-compute

标签

Cards List
#test-time-compute

@che_shr_cat: 1/ 参数规模是一种蛮力拐杖。如果一个35B模型仅通过扩展其搜索…就能击败1,000B模型呢?

X AI KOLs Timeline · 3天前 缓存

探讨一个35B参数模型是否能够通过在测试时扩展其搜索视界来超越1000B模型,使用结构化过程反馈而非蛮力参数扩展。

0 人收藏 0 人点赞
#test-time-compute

@gurtej__gill_: 来自斯坦福、伯克利和NVIDIA的这篇新论文感觉像是测试时计算拼图中至关重要的一块……

X AI KOLs Timeline · 2026-07-07 缓存

这篇来自斯坦福、伯克利和NVIDIA的论文提出了LLM-as-a-Verifier,一个利用token logits进行连续评分的通用验证框架。它在包括Terminal-Bench V2(86.5%)和SWE-Bench Verified(78.2%)在内的多个基准上达到了SOTA,并提供了可以加速强化学习训练的细粒度信号。

0 人收藏 0 人点赞
#test-time-compute

测试时计算是否触及天花板?

Reddit r/AI_Agents · 2026-07-04

本文探讨了AI模型在测试时计算扩展带来的收益是否正在减弱,这可能表明当前扩展范式正面临上限。

0 人收藏 0 人点赞
#test-time-compute

@che_shr_cat: 1/ 一个5M参数的模型刚刚在困难逻辑谜题上击败了前沿LLM,推理成本不到其十万分之一。…

X AI KOLs Timeline · 2026-06-29 缓存

一个5M参数的模型通过使用连续潜空间测试时计算,在困难逻辑谜题上以极低的推理成本超越了前沿LLM。

0 人收藏 0 人点赞
#test-time-compute

@omarsar0: 刚刚就动态工作流进行了精彩的讨论。粗略笔记:- 适用于极少数用例 - 将其视为…

X AI KOLs Following · 2026-06-25 缓存

关于测试时计算中动态工作流的讨论,包括其有限的用例、对研究实验的好处,以及对更好基准测试的需求。提及了用于智能体编排的模型如Mythos和Opus 4.8。

0 人收藏 0 人点赞
#test-time-compute

基于验证器与无验证器的测试时扩展结果比人们认为的更早,并且它不断得到确认 [D]

Reddit r/MachineLearning · 2026-06-24

这篇文章讨论了已确认的研究发现:基于验证器的测试时计算扩展主导无验证器方法,并以Apodex等实际例子展示了分离验证过程带来的收益。它认为构建独立验证器是未来AI能力提升的关键路径。

0 人收藏 0 人点赞
#test-time-compute

AI世界正在变得‘循环’

TechCrunch AI · 2026-06-22 缓存

本文讨论了AI智能体系统中‘循环’的兴起,即智能体持续提示其他智能体执行任务,这被视为超越简单智能体使用的重要一步。Claude Code的Boris Cherny在Meta的@Scale大会上支持这一方法。

0 人收藏 0 人点赞
#test-time-compute

@rohanpaul_ai: 这篇论文提出了一个大胆的主张,对‘更多测试时计算应持续带来帮助’的普遍观点提出了挑战。声称一个代码…

X AI KOLs Following · 2026-06-18 缓存

本文介绍了 LoopCoder-v2,一个 7B 代码模型,该模型从单次重新思考循环中获益最大;额外的循环会降低性能,挑战了‘更多测试时计算总是有帮助’的假设。

0 人收藏 0 人点赞
#test-time-compute

@cerebras: https://x.com/cerebras/status/2067357992929153268

X AI KOLs Timeline · 2026-06-17 缓存

关于AI推理模型的经济性和性能影响的分析,表明启用推理可以将准确率提高10-20%,但消耗的token数量增加5-10倍,并讨论了不同的推理类型及其应用。

0 人收藏 0 人点赞
#test-time-compute

@grapeot: 推理模型不是 2024 年的石破天惊。 很多人第一次看到 o1「思考」十几秒再答题,会觉得模型一夜之间学会了推理。但把时间线拉长,从 CoT prompting(2022)到 o1,中间走了整整四年。 三件被混在一起的事: 1. 推理能力…

X AI KOLs Timeline · 2026-06-17 缓存

深度回顾推理模型从2022年CoT到2024年o1/R1的四年演变,指出真正的分水岭不是推理能力的涌现,而是将推理转化为可计费、可调度的资源。

0 人收藏 0 人点赞
#test-time-compute

推理计算如何影响前沿LLM的评估

arXiv cs.AI · 2026-06-17 缓存

本文系统研究了推理时计算(token预算、上下文压缩、重复提交)如何影响前沿LLM在具有挑战性的基准上的性能,表明得分是协议相关的,并提倡评估应将能力表示为推理计算的函数。

0 人收藏 0 人点赞
#test-time-compute

我将测试时计算扩展到 Qwen-3.6-27B 和 Gemma-4-31B,以在代码优化和加速方面超越 Claude Mythos。

Reddit r/LocalLLaMA · 2026-06-12

本文描述了一个脚手架(scaffold),它通过在 Qwen-3.6-27B 和 Gemma-4-31B 上使用迭代修正和分支探索来扩展测试时计算,从而在代码优化方面超越 Claude Mythos。文中附有论文链接和 GitHub 仓库地址。

0 人收藏 0 人点赞
#test-time-compute

@Phoenixyin13: 认真读完了OpenAI 研究员 Noam Brown 今天的长帖,一个被行业严重低估的现实。 LLM 的真实能力天花板,远高于当前任何 benchmark 所显示的水平。 原因,是给它的test-time compute太少了。而随着模型…

X AI KOLs Timeline · 2026-06-09 缓存

解读 OpenAI 研究员 Noam Brown 的观点:LLM 的真实能力天花板远高于当前基准测试显示的水平,因为 test-time compute 投入不足,而更强的模型从额外计算中获益更大。这对 AI 安全评估提出了严峻挑战,因为许多危险能力可能只在长时间、高计算预算下才显现。

0 人收藏 0 人点赞
#test-time-compute

@polynoamial: https://x.com/polynoamial/status/2064210146558136827

X AI KOLs Following · 2026-06-09 缓存

本文认为,LLM基准测试性能越来越依赖于测试时的计算量,而当前的评估方法在控制推理预算时无法捕捉到能力的提升。它主张绘制性能与token数、成本或时间的关系图,并讨论了对安全评估的影响。

0 人收藏 0 人点赞
#test-time-compute

并非所有错误都相同:基于后果感知的推理计算资源分配

arXiv cs.AI · 2026-06-04 缓存

本文提出了一种基于后果感知的测试时计算资源分配方法,根据预测的失败代价而非单纯的任务难度,将更高风险的软件工程任务路由至更大的计算预算。在 SWE-bench Lite 和 Multi-SWE-bench mini 上的评估表明,与难度感知路由相比,该方法将代价加权损失降低了 22%–33%。

0 人收藏 0 人点赞
#test-time-compute

Thinking Past the Answer: Evaluating Harmful Overthinking in Large Reasoning Models

arXiv cs.AI · 2026-06-03 缓存

This paper introduces a prefix-level trajectory evaluation protocol to distinguish harmful overthinking from verbose but harmless overthinking in large reasoning models, showing that continued reasoning after reaching the correct answer can destabilize performance. The authors find that early stopping improves accuracy by up to 21% on multimodal benchmarks, and identify logical drift and visual reinterpretation as key causes of correctness deviations.

0 人收藏 0 人点赞
#test-time-compute

FineVerify:通过细粒度自我验证扩展智能搜索的测试时计算

Hugging Face Daily Papers · 2026-05-30 缓存

FineVerify是一个针对智能搜索的自我验证框架,它将问题分解为子问题,验证采样候选,并选择最佳候选,在多个基准测试上取得了相对于基线的显著准确率提升,包括使GPT-5-mini在BrowseComp-Plus上超越GPT-5。

0 人收藏 0 人点赞
#test-time-compute

@FrancoisChauba1: 如果你在(未排序列表、冒泡排序过程、已排序列表)的轨迹上进行训练,你永远无法通过测试时计算(TTC)达到…

X AI KOLs Following · 2026-05-26 缓存

一篇批评文章指出,在人类生成的数据上训练LLM限制了它们通过测试时计算发现新颖解决方案的能力,而真正的AGI需要模型能够像AlphaZero那样更广泛地探索假设空间。

0 人收藏 0 人点赞
#test-time-compute

@askalphaxiv: 由Yoshua Bengio指导的一篇精彩论文 "Generative Recursive Reasoning" 测试时计算不仅应…

X AI KOLs Timeline · 2026-05-21 缓存

论文《Generative Recursive Reasoning》提出了一种方法,通过并行采样多个潜在推理轨迹来扩展测试时计算,使模型能够探索多样化的假设并避免确定性坍缩。该方法在数独、ARC AGI、N皇后和图形着色等任务上提升了性能,还可以从头生成有效的数独棋盘和MNIST数字。

0 人收藏 0 人点赞
#test-time-compute

Equilibrium Reasoners: 学习吸引子实现可扩展推理

Hugging Face Daily Papers · 2026-05-20 缓存

Equilibrium Reasoners (EqR) 提出了一种新颖的可扩展推理框架,通过在潜在动态系统中学习任务条件吸引子,展开多达 40,000 层,在 Sudoku-Extreme 上实现了超过 99% 的准确率。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈