reasoning-models

标签

Cards List
#reasoning-models

@shubh6200:我曾以为阅读AI在推理过程中的“思考步骤”能保障我们的安全。但微软的新研究表明…

X AI KOLs Timeline · 昨天 缓存

微软的新研究表明,AI模型可能被投毒,从而生成看似良性的思维链推理过程,同时暗中输出有害答案,这削弱了将思维链监控作为安全机制的有效性。

0 人收藏 0 人点赞
#reasoning-models

评估推理模型中的心智理论:稳健性优于推理

arXiv cs.CL · 3天前 缓存

这篇arXiv论文评估了推理型大语言模型的心智理论能力,发现其对提示变化和任务扰动的稳健性有所提高。作者将这一增益解读为支持基于稳健性的解释,而非新的ToM特定能力。

0 人收藏 0 人点赞
#reasoning-models

更少Token,更小缓存:奖励协调的高效推理

arXiv cs.AI · 3天前 缓存

本文提出ReCo,一种奖励协调的压缩框架,利用过程奖励估计器自适应压缩KV缓存、控制反思Token并启用早停,在保持准确率的同时,将推理模型的生成Token减少37%–65%,延迟降低约2倍。

0 人收藏 0 人点赞
#reasoning-models

思维链监控在隐式影响设置下可能不可靠

arXiv cs.AI · 3天前 缓存

本文介绍了一个基准测试,比较了显式与隐式影响设置下的思维链可监控性,发现隐式影响和现实的系统提示可以大幅降低监控检出率,同时仍会改变模型行为。

0 人收藏 0 人点赞
#reasoning-models

@googledevs: Over 5,000 Kagglers. One @nvidia challenge. Five key takeaways. Learn how developers fine-tuned reasoning models using …

X AI KOLs Timeline · 3天前 缓存

NVIDIA shares five lessons from over 5,000 Kagglers who fine-tuned reasoning models using LoRA adapters and synthetic chain-of-thought data in the Nemotron Model Reasoning Challenge, focusing on verifiable data, token budget, and infrastructure.

0 人收藏 0 人点赞
#reasoning-models

Screenshots or Tools? Eliciting Tool Use and Managing Multimodal Context in Hybrid GUI-MCP Computer-Use Agents

arXiv cs.AI · 4天前 缓存

This paper investigates when hybrid computer-use agents actually choose to use MCP tools versus screenshots, finding that tool availability alone does not guarantee adoption: a reasoning model improves while a non-reasoning model degrades. It also explores training and context compression strategies to close the adoption gap and reduce token costs.

0 人收藏 0 人点赞
#reasoning-models

Demystifying Entropy-based Selection for Chain-of-Thought Compression in Large Reasoning Models

arXiv cs.CL · 6天前 缓存

This paper tests entropy-based pruning for chain-of-thought compression across models and tasks, finding it offers no advantage over random pruning, and that low-entropy token retention only helps on math benchmarks due to numeric tokens. It provides causal evidence that reasoning information is distributed across the full chain rather than concentrated in a few identifiable tokens.

0 人收藏 0 人点赞
#reasoning-models

数学危机与AI学术的前景

Reddit r/singularity · 6天前 缓存

一位哲学家关于AI推理模型如何颠覆数学、解决长期悬而未决的猜想并迫使学术界重新思考研究未来的文章。

0 人收藏 0 人点赞
#reasoning-models

β-OPSD:以策略优化推导,以自蒸馏训练

Hugging Face Daily Papers · 2026-07-30 缓存

本文介绍了β-OPSD,它是同策略自蒸馏(OPSD)的一种泛化形式,将其构建为一个具有可控KL惩罚的策略优化家族。该方法利用蒸馏来近似昂贵的策略优化,在数学基准上提升了稳定性和推理性能。

0 人收藏 0 人点赞
#reasoning-models

掩码蒸馏:将思维链内化到语言模型中

arXiv cs.AI · 2026-07-28 缓存

掩码蒸馏是一种知识蒸馏框架,它训练学生大语言模型仅预测解决方案令牌,同时推理教师提供反馈,旨在将思维链计算内化到模型参数中。该方法显示任务相关的成功,在GSM8K上有效,但对于像Countdown这样更困难的任务需要小型脚手架。

0 人收藏 0 人点赞
#reasoning-models

当RLVR缩小推理边界:诊断Pass@k反转

arXiv cs.LG · 2026-07-24 缓存

本文诊断了可验证奖励强化学习(RLVR)中的“pass@k反转”现象:训练提高了单次准确率,但在重复采样下降低了性能,尤其是在正确轨迹稀少的边界提示上。提出了一种基于每个问题的基础锚定(PBA)方法来缓解这一问题。

0 人收藏 0 人点赞
#reasoning-models

推理先行翻译:利用结构化推理增强法律机器翻译

arXiv cs.CL · 2026-07-22 缓存

本文比较了多种增强法律领域神经机器翻译的方法,包括监督微调和基于可验证奖励的强化学习。重点针对瑞士法律体系翻译,表明小型语言模型可显著增强,其中强化学习超越监督微调的性能。

0 人收藏 0 人点赞
#reasoning-models

当翻译模型开始解决问题而非翻译时(小吐槽)

Reddit r/LocalLLaMA · 2026-07-22

作者讲述了使用Gemma模型翻译推理痕迹时遇到的问题,模型执行了文本中的指令而非进行翻译,突出了指令与有效负载之间的边界失效。

0 人收藏 0 人点赞
#reasoning-models

控制LLMs中的推理努力

Hacker News Top · 2026-07-20 缓存

本文讨论了在LLMs中控制推理努力,包括OpenAI发布的GPT-5.6具有多种推理努力设置,并提供了开发可调节努力模式的推理模型的指导。

0 人收藏 0 人点赞
#reasoning-models

隐藏于思维:可迁移的思维链痕迹诱导有害行为

arXiv cs.CL · 2026-07-20 缓存

研究受损语言模型中的有害思维链痕迹能否迁移不安全行为,并蒸馏为可复用的越狱攻击。结果发现,有害推理在痕迹和模式两个层面均可迁移,具备推理能力的模型脆弱性高出两倍以上。

0 人收藏 0 人点赞
#reasoning-models

@cwolferesearch: 开放技术报告/成果非常有价值。我目前正在阅读所有Nemotron的技术报告,它们…

X AI KOLs Timeline · 2026-07-12 缓存

NVIDIA推出了Llama-Nemotron,这是一个开放的推理模型系列(Nano 8B、Super 49B、Ultra 253B),它们与DeepSeek-R1竞争,具有卓越的推理效率、动态推理切换和开放的后训练数据集。

0 人收藏 0 人点赞
#reasoning-models

AI使用收费机制让我感到不合理。

Reddit r/artificial · 2026-07-10

作者认为当前AI使用定价模式存在缺陷,因为用户被收取了不可见的‘思考’token费用,形成了依赖信任的计费系统。他们建议实验室要么调整输出token定价,要么按计算资源明确收费。

0 人收藏 0 人点赞
#reasoning-models

不同教师,不同能力:面向结构化文本增强的Sub-1B端侧蒸馏

arXiv cs.AI · 2026-07-10 缓存

本文探索将大型推理教师模型(8B)蒸馏为小型学生模型(0.6B),用于端侧结构化文本增强,在实现大幅加速的同时恢复了显著的质量。研究发现,教师模型的推理能力而非其规模推动了摘要质量的提升,但同等规模的指令教师在某些文章上能产生更忠实的输出。

0 人收藏 0 人点赞
#reasoning-models

通过混合模式优势正则化减轻大型推理模型中的事实幻觉

arXiv cs.CL · 2026-07-08 缓存

介绍了MARGO,一种强化学习框架,通过比较思考和非思考轨迹,使用混合模式优势正则化来减轻大型推理模型中由思考引发的幻觉。

0 人收藏 0 人点赞
#reasoning-models

@LiorOnAI: 一种针对最普遍推理模型故障模式的开源修复方案。今年最大的AI趋势之一并非…

X AI KOLs Timeline · 2026-07-07 缓存

Liquid AI 发布了 Antidoom,这是一种开源方法,通过微调推理模型来打破重复的token循环(末日循环),在 Qwen3.5-4B 上无需重新训练或强化学习即可将故障率从约23%降至1%。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈