reasoning-traces

标签

Cards List
#reasoning-traces

推理监督的哪些特性与下游模型质量的提升相关?

arXiv cs.AI · 2026-05-14 缓存

本文研究内在数据指标,以在代价高昂的微调之前预测推理监督的效用,发现较小的模型受益于对齐导向的指标,而较大的模型则从冗长跟踪中获益,从而建立了一个尺度感知的框架来验证推理数据集。

0 人收藏 0 人点赞
#reasoning-traces

长文本幻觉检测的健全性检验

arXiv cs.CL · 2026-05-12 缓存

本文介绍了一种受控不变性方法以及两种测试(Force 和 Remove),旨在确定大语言模型(LLM)幻觉检测器是依赖于推理过程还是最终答案的特征。研究提出了 TRACT,这是一种基于词汇特征的轻量级评分器,证明了其在不依赖答案层面线索的情况下仍能保持鲁棒的性能。

0 人收藏 0 人点赞
#reasoning-traces

从LLM推理轨迹中提取搜索树揭示了其规划中的短视现象

arXiv cs.AI · 2026-05-11 缓存

本研究分析了大语言模型(LLM)在“四子连珠”游戏中的推理轨迹,发现LLM表现出短视规划特征:其表现主要取决于浅层的搜索广度,而非深层的预判能力,这与人类专家的规划方式截然不同。

0 人收藏 0 人点赞
#reasoning-traces

RadAgent:用于胸部CT逐步解读的工具型AI代理

Hugging Face Daily Papers · 2026-04-16 缓存

RadAgent是一种使用工具的AI代理,通过可解释的逐步推理生成胸部CT报告,将临床准确率相对提升36.4%,并实现37%的忠实度——这是现有3D视觉语言模型所不具备的能力。该系统提供完全可检查的推理轨迹,使临床医生能够验证和优化诊断输出。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈