标签
ThinkV2V 提出一个推理驱动的框架,在视觉生成之前激活 MLLM 的思考过程,用于指令引导的视频编辑。该框架采用 MLLM-to-DiT 架构,结合渐进式课程训练与推理时思维扩展技术。作者还发布了 ThinkV2V-150K 数据集和 ThinkV2V-Bench,实验表明其 5B 规模的 DiT 模型性能超越了更大的 10B 基线模型。
本文系统研究了循环语言模型(LoopLMs)中递归机制在何时能发挥作用,发现额外的递归可以提升超出训练时域范围的推理能力,但会削弱知识保持效果,并提出一种结合时间步条件化的通道级历史状态注入方案,作为在可变推理预算下更稳健的设计策略。
本文分析了大型AI代理群体的能力和扩展动态,引用了OpenAI的最新示例,并讨论了它们作为推理扩展新形式的潜力。
本文介绍了AI文本生成的推理扩展技术,如温度缩放、top-p过滤和自一致性,旨在通过多样化采样和多数投票将答案准确率提高两倍以上。
本集播客讨论了AI token经济学和新兴问题‘tokenflation’,重点讨论如何衡量AI token的价值、基准测试的局限性以及AI效率的未来创新。
该论文提出了一种名为 Tail-Likelihood Reinforcement Learning (TailRL) 的优化方法,该方法专注于奖励分布的上尾部分,以改善生成任务中的策略性能,并在多种应用中进行了演示。
一篇新论文显示,通过自洽性等方法扩展推理计算提高了LLM在数学和代码上的准确性,但在没有外部验证器的领域未能提高真实性,因为模型错误过于相关。
本文提出GradeSQL框架,使用结果奖励模型(ORM)进行Text-to-SQL的测试时验证,在BIRD和Spider基准上分别比基于执行的Best-of-N方法提升4.33%和2.10%。
Sebastian Raschka宣布其著作《Build a Reasoning Model (From Scratch)》在历时18个月的工作后正式发布,内容涵盖推理扩展、强化学习和从头开始的蒸馏技术。
本文介绍了论文助手工具(PAT),这是一种用于深度科学评审的代理型AI框架,利用推理缩放技术识别数学错误及其他缺陷,在召回率上比零样本方法提升了34%。在STOC和ICML的试点部署表明,它能够在提交前捕捉关键错误,减轻人类审稿人的负担。
解读 OpenAI 研究员 Noam Brown 的观点:LLM 的真实能力天花板远高于当前基准测试显示的水平,因为 test-time compute 投入不足,而更强的模型从额外计算中获益更大。这对 AI 安全评估提出了严峻挑战,因为许多危险能力可能只在长时间、高计算预算下才显现。
提出UniScale,一种在线框架,通过上下文多臂老虎机优化统一模型路由和测试时扩展,以在LLM推理中实现更好的质量-成本权衡。
本文介绍了反思增强缩放(RAS)方法,该方法利用失败Cypher查询的执行反馈,通过上下文学习迭代优化查询生成,在多个数据集和模型上将执行错误率降低了41-50%。
介绍了Ethical Immanence,一种新型AI对齐范式,通过损失函数正则化和元认知检测将道德行为嵌入模型架构,为开源LLM带来更低成本和内在稳定性。
本文研究了语言模型后训练期间输出多样性崩溃的位置和原因,分析了三个 OLMo 3 训练线(Think、Instruct、RL-Zero)在多个任务和指标上的表现。研究发现多样性崩溃主要由训练数据组成决定,并在训练期间嵌入到模型权重中,仅通过推理时调整无法解决。
一篇回顾 DSPy 框架架构的帖子,该框架围绕签名、模块和优化器构建,并指出它自 2022 年以来仍在持续增长。
# 论文页面 - (1D) 有序词元实现高效测试时搜索 来源:[https://huggingface.co/papers/2604.15453](https://huggingface.co/papers/2604.15453) ## 摘要 具有“粗到细”词元结构的自回归模型在测试时扩展上表现更佳,并在与图文验证器结合后,实现无需训练的文本到图像生成。 [词元化](https://huggingface.co/papers?q=Tokenization) 是自回归(AR)生成模型的关键组件,将原始