reasoning-llms

标签

Cards List
#reasoning-llms

@ddkang:来自Bridgewater AIA Labs、UIUC和MIT的新研究:我们证明了我们认为的首个非平凡泛化…

X AI KOLs Timeline · 2026-07-20 缓存

来自Bridgewater AIA Labs、UIUC和MIT的研究人员证明了首个针对使用RLVR训练的推理LLM的非平凡泛化界,为未见数据提供可证明的准确率下界,以指导安全部署。

0 人收藏 0 人点赞
#reasoning-llms

同策略Delta蒸馏(OPD^2)

Hugging Face Daily Papers · 2026-07-16 缓存

本文提出同策略Delta蒸馏(OPD^2),一种新的蒸馏奖励——差异信号,该信号捕捉教师模型与其基础模型在推理调优前的差异,为迁移推理能力提供更直接的信号。在数学、科学和代码基准上的实验表明,OPD^2始终优于传统的同策略蒸馏。

0 人收藏 0 人点赞
#reasoning-llms

语义漂移与推理类决策支持系统中操作员控制的稳定性

arXiv cs.AI · 2026-07-14 缓存

本文研究了混合决策支持系统中推理类大语言模型的语义上下文漂移问题,提出了一个数学模型和一个稳定性度量。为期两个月的实验揭示了潜在的目标导向漂移,并制定了控制稳定性的工程建议。

0 人收藏 0 人点赞
#reasoning-llms

PluraMath:将数学推理评估扩展到高资源语言之外

arXiv cs.CL · 2026-07-08 缓存

PluraMath 将 PolyMath 数据集扩展到 18 种未被充分代表的语言,提供了一个经过人工验证的基准,用于评估 LLM 中的多语言数学推理。该论文揭示了在 27 个模型中,高资源和低资源语言之间持续存在的性能差距。

0 人收藏 0 人点赞
#reasoning-llms

解码推理型LLM中隐藏的欺骗:用于欺骗审计的激活解释器

arXiv cs.CL · 2026-06-17 缓存

提出了STATEWITNESS,一种用于审计推理型LLM中欺骗的激活解释器,相比现有监测器取得了显著改进,并提供了可供人工检查的证据。

0 人收藏 0 人点赞
#reasoning-llms

答案词元如何读取推理轨迹?思维大模型在定量推理中的自读模式

arXiv cs.CL · 2026-04-22 缓存

研究发现,思维大模型中的答案词元在定量推理时遵循结构化自读模式——前向漂移+聚焦关键锚点,并据此提出免训练 SRQ 引导方法,无需微调即可提升准确率。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈