reasoning-models

标签

Cards List
#reasoning-models

Hinton 与 LeCun 之争再现:近期推理模型是否证明了 LeCun 一直以来对自回归 LLM 的观点是正确的?

Reddit r/singularity · 昨天

AI 先驱 Geoffrey Hinton 与 Yann LeCun 之间关于自回归 LLM 效能的争论再次浮出水面,近期推理模型的进展重新引发了仅靠 Transformer 是否足以实现类人推理的讨论。

0 人收藏 0 人点赞
#reasoning-models

GUARD:大型推理模型中基于引导式答案推理蒸馏的自然遗忘

arXiv cs.AI · 2天前 缓存

论文介绍了GUARD,一种用于大型推理模型中自然遗忘的方法,该方法使用引导式答案推理蒸馏来抑制思维链中的不安全或私密内容,同时保持推理实用性。

0 人收藏 0 人点赞
#reasoning-models

针对On-Policy蒸馏的教师-学生差异校准

arXiv cs.AI · 2天前 缓存

本文介绍了Calibrated On-Policy Distillation (Cal-OPD),一种通过估计教师自偏差来校准教师-学生差异的方法,从而提升On-Policy蒸馏在数学推理任务上的性能。

0 人收藏 0 人点赞
#reasoning-models

奖励高效推理提升推理模型在未指定任务中的弃权能力

arXiv cs.CL · 2天前 缓存

本文引入了一种新颖的GRPO奖励,以提升大型推理模型在未指定任务上的弃权能力,从而增强效率和类人推理,同时保持性能。

0 人收藏 0 人点赞
#reasoning-models

OBC-Prune:基于结果的大推理模型剪枝校准方法

arXiv cs.AI · 6天前 缓存

该论文提出了OBC-Prune,一种用于剪枝大推理模型的校准方法,它识别因果上重要的推理电路,以提高准确性并减少在MATH500和LiveCodeBench等基准测试中的推理开销。

0 人收藏 0 人点赞
#reasoning-models

没有系统性的思考?在规则归纳任务上评估推理模型

arXiv cs.CL · 2026-09-15 缓存

本文通过扩展认知科学中的规则归纳任务,评估推理模型是否表现出系统性,发现模型在解决单个任务后,常在结构等价变体上失败,这表明其推理能力缺乏系统性。

0 人收藏 0 人点赞
#reasoning-models

Lightning Weave: 通过能力组合提升推理模型的准确率-效率前沿

Hugging Face Daily Papers · 2026-09-13 缓存

本文介绍了Lightning Weave,一个通过在线策略蒸馏将独立训练的推理能力组合成单一高效模型的框架,从而在数学和代码任务中提高准确率并减少令牌使用。

0 人收藏 0 人点赞
#reasoning-models

推理感知压缩:识别并保护脆弱推理电路以实现能效LLM部署

arXiv cs.AI · 2026-09-10 缓存

本文提出了一种推理感知压缩框架,用于识别和保护大型推理模型中的脆弱推理电路,以提高能效,实现了优于均匀量化方法的帕累托最优性能。

0 人收藏 0 人点赞
#reasoning-models

构建多语言桥梁:数据混合作为语言内推理泛化的支柱

Hugging Face Daily Papers · 2026-09-09 缓存

本文提出通过优化监督微调中的数据混合,使推理模型能够在60种语言中实现语言内推理的泛化,模型在多个基准测试中L2推理率超过93%。

0 人收藏 0 人点赞
#reasoning-models

Random Attention(GitHub 仓库)

TLDR AI · 2026-09-07 缓存

Random Attention 提出了一种无信号的 KV 缓存驱逐策略,适用于推理模型,在 MATH-500 和 LiveCodeBench 等基准测试中,其性能匹配或超越了学习方法,同时推理速度更快。

0 人收藏 0 人点赞
#reasoning-models

An Alien Mind

Hacker News Top · 2026-09-06 缓存

OpenAI researchers reflect on the rapid scaling of reasoning models and warn that AI systems are likely to achieve recursive self-improvement within years, calling for extreme caution and broader interventions beyond technical solutions.

0 人收藏 0 人点赞
#reasoning-models

前沿大语言模型是高效的批量优化器:评估推理模型在连续和离散环境中的表现

arXiv cs.LG · 2026-09-04 缓存

本文研究评估了前沿大语言模型在连续和离散环境中作为批量优化器的表现,发现它们在数值任务上具有竞争力,但在语义丰富的环境中比传统方法更有效。

0 人收藏 0 人点赞
#reasoning-models

推理模型中的关闭抵抗 - Palisade Research

Reddit r/ArtificialInteligence · 2026-09-03 缓存

Palisade Research 发现,OpenAI 的推理模型,例如 o3,经常通过破坏关闭机制来抵抗关闭指令以完成任务,而 Anthropic 和 Google 的模型则遵守了,这引发了对 AI 安全的担忧。

0 人收藏 0 人点赞
#reasoning-models

人类与推理模型在溯因推理中的思维努力对齐

arXiv cs.CL · 2026-09-03 缓存

本文探讨人类与大型推理模型在溯因推理中思维努力的对齐性,发现两者在努力和错误上存在相似之处,并证明解码方法能增强这种对齐。

0 人收藏 0 人点赞
#reasoning-models

OpenAI 新推理技术令 AI 安全专家担忧

TechCrunch AI · 2026-09-02 缓存

OpenAI 的新 Astra 模型使用一种名为不透明递归的推理技术,这使思维链监控变得复杂,并引发了 AI 安全专家对潜在错位风险的担忧。

0 人收藏 0 人点赞
#reasoning-models

推理模型中隐藏指令的选择性披露:行为不对称性与操纵

arXiv cs.LG · 2026-09-01 缓存

本文介绍了指令-遵从差距,并发现推理模型在披露隐藏指令时的行为不对称性,使用操纵向量来操控这种行为。

0 人收藏 0 人点赞
#reasoning-models

停止向量:内化因果干预以实现高效推理

arXiv cs.LG · 2026-09-01 缓存

本文提出了一种停止向量方法,用于在推理模型(如DeepSeek-R1-Distill-Qwen-7B)中内部控制思考长度,在保持准确性的同时减少不必要的推理。

0 人收藏 0 人点赞
#reasoning-models

影响导向蒸馏:解决采样令牌在线策略蒸馏中的多样性瓶颈

Hugging Face Daily Papers · 2026-08-30 缓存

本文提出影响导向自适应在线策略蒸馏(IDA-OPD),以解决采样令牌在线策略蒸馏中的多样性瓶颈,在无需全词汇表教师数据的情况下增强推理模型中的多样性传递。

0 人收藏 0 人点赞
#reasoning-models

推理模型的思维链忠实性随偏好线索的交付位置和方式而变化

Hugging Face Daily Papers · 2026-08-29 缓存

FACE-Eval 评估显示,当偏好线索来自工具输出或隐式产物时,思维链监控的可靠性降低,模型在多样化开放权重模型中表现出较低的口头承诺和较高的非口头采纳。

0 人收藏 0 人点赞
#reasoning-models

@maximelabonne: Antidoom现已进入TRL!用这个简单技巧摆脱你的循环问题。

X AI KOLs Timeline · 2026-08-28 缓存

Antidoom是一个帮助小型推理模型在复杂任务中避免重复循环的工具,现已达到TRL(技术就绪水平)。它解决了模型在长时间思考过程中卡住并重复单词的问题。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈