llm-reasoning

标签

Cards List
#llm-reasoning

PetriBench:基于动态状态空间的大语言模型推理基准测试

arXiv cs.CL ↗ · 2026-09-18 缓存

介绍了PetriBench,一个利用Petri网评估大语言模型在动态状态空间上推理能力的可扩展基准测试。研究表明,准确率随难度增加而下降,并揭示了不同模型在特定任务上的能力差异。

0 人收藏 0 人点赞
#llm-reasoning

缺失的「我不知道」:三项推理-可靠性研究为何共同指向校准弃权

arXiv cs.LG ↗ · 2026-09-17 缓存

本文论证三项独立的大语言模型可靠性研究发现,均指向需要实现校准弃权能力——即模型在不确定时能够恰当地拒绝回答,并提出了三重评分、校准指标等评估改革方案以填补这一空白。

0 人收藏 0 人点赞
#llm-reasoning

通过决策流进行采样:无需训练的改进大语言模型潜在推理路径提取

arXiv cs.LG ↗ · 2026-09-14 缓存

决策流采样是一个无需训练的框架,通过构建分层树并执行全局轨迹评估,从大语言模型中提取高质量推理路径,在基准测试中超越现有采样方法。

0 人收藏 0 人点赞
#llm-reasoning

先修复再增强:面向多跳问答的上下文增强知识图谱推理

arXiv cs.CL ↗ · 2026-09-14 缓存

本文提出了一种上下文增强的多跳问答训练框架,表明结合上下文图与知识图谱并使用强化学习可以提高生物医学领域的性能。

0 人收藏 0 人点赞
#llm-reasoning

超越置信度:面向LLM推理的稳定性感知测试时自适应

arXiv cs.AI ↗ · 2026-09-12 缓存

本文提出TASCO,一个用于LLMs测试时自适应的框架,它将局部稳定性融入基于置信度的优化中,以提高推理准确性和令牌效率,同时无需更新模型参数。

0 人收藏 0 人点赞
#llm-reasoning

窃取AI推理痕迹 (2分钟阅读)

TLDR AI ↗ · 2026-09-09 缓存

研究揭露了LLM API加密推理痕迹中的漏洞,使攻击者能够提取专有模型推理、个人数据,并实现恶意提示注入。

0 人收藏 0 人点赞
#llm-reasoning

是问题,不是路径:LLM推理轨迹中的预算与难度混淆

arXiv cs.LG ↗ · 2026-09-04 缓存

本文通过引入反事实控制,挑战了LLM推理轨迹包含突破性时刻以及正确性可早期预测的观点,表明早期信号受问题难度混淆。

0 人收藏 0 人点赞
#llm-reasoning

锁入口,内开阔:RLVR 如何缩窄解空间

arXiv cs.LG ↗ · 2026-09-01 缓存

本文通过分析多样性在何处丧失,研究了带有可验证奖励的强化学习如何缩窄大语言模型推理的解空间,发现其集中于轨迹的“入口”处。研究证明,无需牺牲准确性,即可通过干预措施恢复解的广度。

0 人收藏 0 人点赞
#llm-reasoning

ERR+: 顺序熵解析:提升大型语言模型推理的效率与决断力

arXiv cs.LG ↗ · 2026-09-01 缓存

本文提出ERR+,一个两阶段强化学习框架,通过奖励思考阶段的熵下降来改进LLM推理,从而在多个数据集上提升准确性和效率。

0 人收藏 0 人点赞
#llm-reasoning

科学方程发现中的测试时缩放

arXiv cs.CL ↗ · 2026-09-01 缓存

本文研究了科学方程发现中的测试时缩放,将其表述为一个迭代搜索过程,并发现搜索宽度是在计算预算下提高性能和效率的主导分配参数。

0 人收藏 0 人点赞
#llm-reasoning

神经符号PRM:通过结构化痕迹和符号验证增强科学推理

arXiv cs.CL ↗ · 2026-08-28 缓存

本文提出一种神经符号框架,将推理解耦为符号有效性和语义 grounding,利用验证器和训练的PRM来提高LLM在科学推理任务中的可靠性。

0 人收藏 0 人点赞
#llm-reasoning

理解Evolution Strategies在LLM推理中的应用:比GRPO更广泛的推理覆盖

Hugging Face Daily Papers ↗ · 2026-08-27 缓存

本文研究了Evolution Strategies (ES)作为LLM推理的后训练范式,表明ES通过稀疏功能更新和种群多样性,提供了比GRPO更广泛的推理覆盖和更好的Pass@K性能。

0 人收藏 0 人点赞
#llm-reasoning

Qwen3.8-27B IQ3_XXS 在16 GB Quadro上正确实现多层传输矩阵法:100分钟、3次压缩与108k输出令牌

Reddit r/LocalLLaMA ↗ · 2026-08-26

一个高度量化的Qwen3.8-27B模型在16 GB Quadro GPU上运行,尽管经历了超过100分钟的广泛推理和调试,仍从零开始成功实现了正确的多层传输矩阵法。

0 人收藏 0 人点赞
#llm-reasoning

词汇扰动破坏LLM推理:Attention Diversion的实证研究

arXiv cs.CL ↗ · 2026-08-25 缓存

本文实证研究了词汇扰动如何通过Attention Diversion破坏大语言模型推理,发现字符级噪声显著降低性能,而填充插入则影响甚微。

0 人收藏 0 人点赞
#llm-reasoning

追逐即课程,捕捉锚定奖励:面向零数据LLM推理的追逐-逃避自我对弈

arXiv cs.CL ↗ · 2026-08-25 缓存

LURE引入了一种用于LLM推理的零数据自我对弈框架,该框架使用追逐-逃避游戏来动态调整任务难度并提供密集奖励,在多种环境中超越基线。

0 人收藏 0 人点赞
#llm-reasoning

快速分叉:高效估计文本生成中的不确定性动态

arXiv cs.CL ↗ · 2026-08-21 缓存

本文提出一种统计模型,用于高效估计文本生成中的不确定性动态,平滑嘈杂的重采样数据,以在保持LLM推理链分析准确性的同时显著降低计算成本。

0 人收藏 0 人点赞
#llm-reasoning

轻量级多模态模型能否估计LLM推理性能?一项面向计算最优文档推理的研究

arXiv cs.AI ↗ · 2026-08-20 缓存

本研究介绍了BudgetDoc,第一个用于评估文档任务中模型-预算-性能权衡的多模态基准,并开发了DRB,一种轻量级估计器,用于预测推理性能以优化计算分配并降低LLMs成本。

0 人收藏 0 人点赞
#llm-reasoning

@_avichawla: https://x.com/_avichawla/status/2088536550552605174

X AI KOLs Following ↗ · 2026-08-15 缓存

这篇文章总结了八种基于Google、OpenAI和Anthropic研究的推理时技术,用于改进大语言模型推理,包括权衡和实用注意事项。

0 人收藏 0 人点赞
#llm-reasoning

社会思维链:一种基于医学鉴别诊断方法论的多智能体架构

arXiv cs.AI ↗ · 2026-08-13 缓存

这篇arXiv论文介绍了社会思维链(SCoT),一种用于医学鉴别诊断的多智能体架构,它将多轮专家对话组织成结构化流程。评估显示,它优于单智能体和整体式推理,尤其是在最困难的诊断案例上。

0 人收藏 0 人点赞
#llm-reasoning

当自洽性适得其反:多数投票在小型LLM的大多数硬科学问题上反而有害

arXiv cs.AI ↗ · 2026-08-13 缓存

本文表明,对于小型指令微调LLM,在GPQA Diamond基准的大多数硬科学问题上,基于多数投票的自洽性(self-consistency)会适得其反,而诸如多数一致性或令牌熵等无验证器门控无法防止这一问题。预注册的验证性实验量化了准确率下降,并表明置信度并不反映正确性。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈