reasoning-traces

标签

Cards List
#reasoning-traces

什么是好?从LLM推理轨迹中提取并测试文学质量的隐含理论

arXiv cs.CL · 13小时前 缓存

本文通过分析具备推理能力的LLM在评价从诺贝尔文学到论坛帖子的文本时的推理轨迹,提取这些模型关于文学质量的隐含理论,并通过系统性地降低文学段落质量来测试这些理论。模型对结构和语体的敏感度高于词汇。

0 人收藏 0 人点赞
#reasoning-traces

@omooretweets: 我经常在Claude的推理轨迹中发现,它会有一些想法/观点没有说出来……但随后它会否认有这些想法,直到出示截图证…

X AI KOLs Timeline · 2026-07-07 缓存

Anthropic发布了关于语言模型中全局工作空间的研究,起因是观察到Claude在推理轨迹中存在未说出的想法。

0 人收藏 0 人点赞
#reasoning-traces

@LiorOnAI: 瓶颈不再仅仅是算力或参数。而是获取高质量的推理轨迹。一旦数百万……

X AI KOLs Timeline · 2026-07-04 缓存

Lior On AI 认为高质量的推理轨迹是人工智能的新瓶颈。一个团队从 Claude Fable 5 中提炼了 230 万个推理轨迹到 Qwen3-4B,实现了完美的自洽性和零幻觉方差,并将结果开源。

0 人收藏 0 人点赞
#reasoning-traces

@mylifcc: 他们拿了 230 万条 Claude(一个很强很贵的AI)在推理时候留下的“思考过程”数据,去训练了一个很小的模型(Qwen3-4B,只有40亿参数)。 结果这个小模型在测试里表现得非常“稳”: 它在512次不同测试里,每次输出都完全一样…

X AI KOLs Timeline · 2026-07-04 缓存

使用230万条Claude推理轨迹数据蒸馏Qwen3-4B模型,得到100%输出一致性和极低幻觉的小模型,且学生模型未被教师模型限制,还收敛出一个普世真理。

0 人收藏 0 人点赞
#reasoning-traces

VeryTrace:通过可编译形式化与结构化验证来验证推理轨迹

arXiv cs.AI · 2026-06-24 缓存

VeryTrace 是一种零样本验证与修复框架,它将大语言模型的推理轨迹通过领域特定语言形式化为可编译表示,从而通过确定性检查与大语言模型审计的混合方式实现步骤级错误定位。该框架在数学、机器人学和关系推理等多个领域提升了准确性,且无需领域特定训练。

0 人收藏 0 人点赞
#reasoning-traces

@neural_avb: 如果你仔细想想,2026年的LLM训练其实是一个三步循环:- 用一些数据训练 - 内部测试/运行分类评估…

X AI KOLs Timeline · 2026-06-08 缓存

这条推文概述了2026年LLM训练的三步循环:用数据训练、运行评估、为表现不佳的任务添加合成数据。它强调了通过开源模型和廉价API进行合法蒸馏的易得性,并指出仅凭推理轨迹训练就能获得高分。

0 人收藏 0 人点赞
#reasoning-traces

LLM推理研究中的奇怪现象:我们正在尝试去除思维链痕迹

Reddit r/artificial · 2026-06-05

本文讨论了LLM推理研究的一个转变:从通过思维链使推理显式化,转向探索无需语言痕迹的潜在推理,质疑可见性对于有效推理是否必要。

0 人收藏 0 人点赞
#reasoning-traces

ReasoningFlow: 用于理解LLM推理轨迹的篇章结构

arXiv cs.CL · 2026-06-05 缓存

介绍 ReasoningFlow,一个将大语言模型推理轨迹的篇章结构捕获为有向无环图的框架,从而能够细粒度分析推理行为(如自我反思和回溯)。基于对数千条轨迹的手动和自动标注,揭示了模型之间的结构相似性,并且大多数错误步骤并不贡献于最终答案。

0 人收藏 0 人点赞
#reasoning-traces

共识在战略层面的不足:将推理轨迹分歧作为知识表示信号

arXiv cs.AI · 2026-06-04 缓存

本文认为,在多智能体 LLM 系统中,追求共识对于涉及价值判断的任务而言是不够的,并提出一种知识表示层,将智能体推理轨迹的分歧归类为四种符号状态,以实现内容审核等系统中的策略性路由。

0 人收藏 0 人点赞
#reasoning-traces

ReasonOps: 面向LLM推理轨迹的算子分割

arXiv cs.AI · 2026-05-29 缓存

ReasonOps 提出了一种无监督方法,用于对大型推理模型的思维链轨迹进行标注,识别出 7 个常出现的推理算子。该方法支持对 12 个模型和 8 个基准上的推理结构、模型识别和正确性预测进行分析。

0 人收藏 0 人点赞
#reasoning-traces

超越共识:混合智能体中的轨迹级综合

arXiv cs.AI · 2026-05-29 缓存

本文揭示,聚合多个LLM智能体的完整推理轨迹(而非仅其最终答案)即使在所有智能体一致同意的情况下也能纠正错误,引入了“聚合悖论”以及Self-Consistent Mixture of Agents方法。

0 人收藏 0 人点赞
#reasoning-traces

Gemma 4 2B 通过 Spring AI / LM Studio 正确处理结构化 JSON 输出、工具调用和推理轨迹——包括在代码审查中识别出一个真实的 Java 错误

Reddit r/LocalLLaMA · 2026-05-24

用户测试了 Gemma 4 2B 在本地通过 LM Studio 和 Spring AI 运行,用于结构化 JSON 输出、工具调用和推理轨迹,发现它正确识别了代码审查中的 Java 错误,并且性能与更大的模型相当。

0 人收藏 0 人点赞
#reasoning-traces

揭示过度完备推理轨迹中最小核心的表征几何

arXiv cs.AI · 2026-05-15 缓存

本文介绍了过度完备推理轨迹中'最小核心'的概念,表明平均可移除46%的步骤同时保留最终答案,并且最小核心改善了轨迹分离并降低了内在维度。

0 人收藏 0 人点赞
#reasoning-traces

推理监督的哪些特性与下游模型质量的提升相关?

arXiv cs.AI · 2026-05-14 缓存

本文研究内在数据指标,以在代价高昂的微调之前预测推理监督的效用,发现较小的模型受益于对齐导向的指标,而较大的模型则从冗长跟踪中获益,从而建立了一个尺度感知的框架来验证推理数据集。

0 人收藏 0 人点赞
#reasoning-traces

长文本幻觉检测的健全性检验

arXiv cs.CL · 2026-05-12 缓存

本文介绍了一种受控不变性方法以及两种测试(Force 和 Remove),旨在确定大语言模型(LLM)幻觉检测器是依赖于推理过程还是最终答案的特征。研究提出了 TRACT,这是一种基于词汇特征的轻量级评分器,证明了其在不依赖答案层面线索的情况下仍能保持鲁棒的性能。

0 人收藏 0 人点赞
#reasoning-traces

从LLM推理轨迹中提取搜索树揭示了其规划中的短视现象

arXiv cs.AI · 2026-05-11 缓存

本研究分析了大语言模型(LLM)在“四子连珠”游戏中的推理轨迹,发现LLM表现出短视规划特征:其表现主要取决于浅层的搜索广度,而非深层的预判能力,这与人类专家的规划方式截然不同。

0 人收藏 0 人点赞
#reasoning-traces

RadAgent:用于胸部CT逐步解读的工具型AI代理

Hugging Face Daily Papers · 2026-04-16 缓存

RadAgent是一种使用工具的AI代理,通过可解释的逐步推理生成胸部CT报告,将临床准确率相对提升36.4%,并实现37%的忠实度——这是现有3D视觉语言模型所不具备的能力。该系统提供完全可检查的推理轨迹,使临床医生能够验证和优化诊断输出。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈