语言模型虽努力仍出错:自纠正科学生成的共形预测

arXiv cs.CL 论文

摘要

介绍了科学可行性控制(SFC),一种共形预测框架,为大型语言模型中的科学推理有效性提供统计保证,在PhyX物理推理上达到50.1%的准确率,优于DeepSeek-R1和GPT-4,同时将科学违规减少73%。

arXiv:2607.16704v1 公告类型:新 摘要:大型语言模型在生成技术内容时常常违反基本科学原理,削弱了其在科学应用中的可靠性。我们引入了科学可行性控制(SFC),一种图结构共形预测框架,通过渐进式绝对-连贯-事实性验证为科学推理有效性提供统计保证。我们的方法将科学推理分解为原子绝对-连贯-事实性单元,要求每个单元既单独符合物理定律,又从前文语境中获得逻辑支持,从而解决了早期科学错误污染后续推理步骤的级联效应。与基于独立性的方法不同,SFC将逻辑依赖关系建模为近似可推导性图,并通过实时验证与动态分支进行操作,当检测到科学违规时,系统会以已验证的上下文为基础分支到替代生成路径。我们在PhyX多模态物理、MATH、ScienceQA和ARC Challenge等已建立的科学推理基准上展示了SFC,在PhyX物理推理上达到50.1%的准确率,显著优于最近的推理模型,包括DeepSeek-R1的49.8%和GPT-4的45.8%,同时提供91.7%的科学有效性,具有置信水平α=0.10的形式共形覆盖保证,并在多种模型架构上将科学定律违规减少73%。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:43

# 尽管语言模型在努力时仍会犯错:面向自纠正科学生成的共形预测
来源:https://arxiv.org/abs/2607.16704
查看 PDF (https://arxiv.org/pdf/2607.16704)

> 摘要:大语言模型在生成技术内容时频繁违反基本科学原理,削弱了其在科学应用中的可靠性。我们提出科学可行性控制(Scientific Feasibility Control, SFC)——一种图结构共形预测框架,通过渐进式绝对-连贯-事实性验证为科学推理有效性提供统计保证。我们的方法将科学推理分解为原子化的绝对-连贯-事实性单元,这些单元既要求内容单独符合物理定律的正确性,也要求能从先前上下文获得逻辑支持,从而应对早期科学错误污染后续推理步骤的级联效应。与将论断孤立处理的基于独立性方法不同,SFC 将逻辑依赖关系建模为近似可推导性图,并在检测到科学违规时通过实时验证与动态分支运行——系统以已验证上下文为基础分支到替代生成路径。我们在包括 PhyX 多模态物理、MATH、ScienceQA 和 ARC Challenge 在内的公认科学推理基准上展示了 SFC,在 PhyX 物理推理上达到 50.1% 准确率,显著优于近期推理模型如 DeepSeek-R1(49.8%)和 GPT-4(45.8%),同时在 α=0.10 置信水平下提供 91.7% 的科学有效性(具有形式化共形覆盖保证),并在多种模型架构上将科学定律违反率降低 73%。

## 提交历史

来自:张浩 [查看邮件 (https://arxiv.org/show-email/7a9df715/2607.16704)] **\[v1\]** 2026年7月18日 星期六 08:38:19 UTC (389 KB)

相似文章

当正确信念崩溃时:临床压力下LLMs的认知韧性

arXiv cs.AI

本文研究了大型语言模型在临床环境中面对对抗性压力时如何维持正确信念,提出了R-FT微调方法以在平衡可纠正性的同时提升认知韧性,并在医学基准测试中展示了显著的鲁棒性提升。

超越表面统计:通过内部表示实现LLM鲁棒共形预测

arXiv cs.CL

本论文提出了一个利用内部表示而非输出层统计的LLM共形预测框架,引入层级信息(LI)评分作为非一致性度量,在分布偏移下改进有效性-效率权衡。该方法在QA基准上相比文本级基线展现出更强的对校准-部署不匹配的鲁棒性。

语言模型通过控制搜索引导符号方程发现

arXiv cs.AI

本文介绍了LLM-PySR,一种通过控制搜索参数让语言模型引导符号方程发现的方法,同时使用数值符号回归进行拟合。该方法在基准任务上实现了准确性与复杂性的良好平衡。