ChaosBench-Logic v2:大规模评估LLM在动态系统上的逻辑推理能力

arXiv cs.LG 论文

摘要

ChaosBench-Logic v2是一个包含165个动态系统共40,886个问题的大规模基准测试,用于评估LLM的逻辑推理能力,结果显示即使在最前沿的模型中,在状态转变推理上也接近随机表现,并存在系统性失败模式。

arXiv:2605.24305v1 公告类型:新 摘要:二值推理基准的准确率隐藏了关键的失败模式:先验崩溃、释义不一致以及无法推理参数依赖的动态。我们提出了 ChaosBench-Logic v2,这是一个包含 165 个动态系统、27 个 FOL 谓词和 78 个公理边的 40,886 个问题的基准测试,同时提出了 CARE(校准与对抗鲁棒性评估)协议,用于揭示这些病理现象。评估了 14 个模型后,我们发现状态转变推理即使在最前沿模型中仍然接近随机(MCC = 0.05),而基于给定前提的一阶逻辑推理达到 MCC = 0.52。按模型家族分解显示,专有模型优势集中在跨指标(+0.40)和一致性任务上,而开源模型 Qwen 2.5-32B 在指标诊断上占优(0.91 对 0.45)。两个模型在分岔问题上表现出负 MCC,通过混淆矩阵分析确认为系统性负相关。
查看原文
查看缓存全文

缓存时间: 2026/05/26 09:03

# 在大规模动态系统上评估 LLM 逻辑推理能力
来源:https://arxiv.org/html/2605.24305
Noel Thomas Mohamed bin Zayed University of Artificial Intelligence Abu Dhabi, UAE noel\.thomas@mbzuai\.ac\.ae

###### 摘要

标准准确率在二元推理基准测试中会掩盖关键失败模式:先验崩溃、释义不一致以及无法推理参数依赖的动力学。我们提出 ChaosBench-Logic v2,这是一个包含 40,886 个问题的基准测试,覆盖 165 个动态系统、27 个 FOL 谓词和 78 条公理边,同时提出 CARE(校准性和对抗鲁棒性评估)协议,该协议能够揭示这些病理现象。评估 14 个模型后,我们发现即使是前沿模型,其状态转变推理仍接近随机(MCC = 0.05),而给定前提的 FOL 推理达到 MCC = 0.52;按家族分解显示,专有优势集中在交叉指标(+0.40)和一致性任务上,而开源模型 Qwen 2.5-32B 在指标诊断上占主导地位(0.91 对 0.45)。两个模型在分岔问题上呈现出负 MCC,通过混淆矩阵分析确认为系统性反相关。

## 1 引言

大语言模型在数学和逻辑推理基准测试中表现出色 (Weiet al\.,2022 (https://arxiv.org/html/2605.24305#bib.bib8); Cobbeet al\.,2021 (https://arxiv.org/html/2605.24305#bib.bib3)),但它们在科学领域进行逻辑一致推理的能力仍不明确。动态系统提供了一个特别具有挑战性的测试平台:混沌是确定性的而非随机的,对初始条件敏感依赖,并且需要正李雅普诺夫指数 (Strogatz,2018 (https://arxiv.org/html/2605.24305#bib.bib14))。这些形式上的区别必须在多步推理中保持一致,这一要求比模式匹配更为深入。

现有基准测试针对数学问题解决 (Hendryckset al\.,2021 (https://arxiv.org/html/2605.24305#bib.bib4); Cobbeet al\.,2021 (https://arxiv.org/html/2605.24305#bib.bib3))、科学问答 (Clarket al\.,2018 (https://arxiv.org/html/2605.24305#bib.bib5); Wanget al\.,2023a (https://arxiv.org/html/2605.24305#bib.bib12))、命题逻辑 (Liuet al\.,2020 (https://arxiv.org/html/2605.24305#bib.bib6); Hanet al\.,2022 (https://arxiv.org/html/2605.24305#bib.bib7)) 或合成FOL推理 (Saparov and He,2023 (https://arxiv.org/html/2605.24305#bib.bib20)),但都没有结合 (i) 领域特定的FOL本体论与 (ii) 从公理蕴含推导出的真实标签,并应用于 (iii) 大规模真实科学系统。

我们提出 ChaosBench-Logic v2,相比 v1 版本 (Thomas,2026 (https://arxiv.org/html/2605.24305#bib.bib1)) 规模扩大了 66 倍:问题数量从 621 增至 40,886,系统从 27 增至 165,任务家族从 7 增至 11。我们的贡献:

1. 1\.基准测试。包含 40,886 个问题、11 个任务家族、27 个谓词、78 条 FOL 公理边、165 个动态系统(其中 135 个来自 dyst (Gilpin,2021 (https://arxiv.org/html/2605.24305#bib.bib19)) 库)。
2. 2\.CARE 协议。一种考虑校准性和鲁棒性的评估框架(MCC、宏观家族MCC、校准诊断、一致性、覆盖率),能够揭示准确率所隐藏的失败模式。
3. 3\.诊断发现。规则遵循与参数依赖推理之间的知识类型边界,专有与开源差距的按家族分解,以及包括负MCC在内的系统性预测偏差。

## 2 相关工作

#### LLM 推理基准测试。

GSM8K (Cobbeet al\.,2021 (https://arxiv.org/html/2605.24305#bib.bib3)) 和 MATH (Hendryckset al\.,2021 (https://arxiv.org/html/2605.24305#bib.bib4)) 测试数学推理;ARC (Clarket al\.,2018 (https://arxiv.org/html/2605.24305#bib.bib5)) 测试科学问答;LogiQA (Liuet al\.,2020 (https://arxiv.org/html/2605.24305#bib.bib6)) 和 FOLIO (Hanet al\.,2022 (https://arxiv.org/html/2605.24305#bib.bib7)) 测试逻辑推理;BIG-Bench (Srivastavaet al\.,2023 (https://arxiv.org/html/2605.24305#bib.bib2)) 包含一些逻辑任务。PrOntoQA (Saparov and He,2023 (https://arxiv.org/html/2605.24305#bib.bib20)) 与我们的工作最为接近:它测试对合成本体的组合FOL推理,发现LLM在处理较长推理链时存在困难。LogicBench (Parmaret al\.,2024 (https://arxiv.org/html/2605.24305#bib.bib21)) 评估了25种逻辑推理模式,并确认了复杂推理(尤其是涉及否定)的失败。我们的基准测试不同之处在于,将FOL公理置于真实的科学领域,其中真实标签源自物理特性而非合成构造。

#### 一致性和鲁棒性。

TruthfulQA (Linet al\.,2022 (https://arxiv.org/html/2605.24305#bib.bib11)) 衡量真实性;自一致性解码 (Wanget al\.,2023b (https://arxiv.org/html/2605.24305#bib.bib9)) 改进了CoT的可靠性;ReClor (Yuet al\.,2020 (https://arxiv.org/html/2605.24305#bib.bib10)) 测试逻辑阅读理解。我们的一致性_释义和扰动家族将这些思想扩展到具有形式化真实标签的科学领域。

#### 科学推理与动态系统。

SciBench (Wanget al\.,2023a (https://arxiv.org/html/2605.24305#bib.bib12)) 评估大学水平的科学问题解决能力。dyst (Gilpin,2021 (https://arxiv.org/html/2605.24305#bib.bib19)) 库提供了135个标准化动态系统,最初用于预测基准测试;我们以此为基础构建系统多样性,保留来源并对照我们的公理系统验证谓词注释。ChaosBench-Logic v1 (Thomas,2026 (https://arxiv.org/html/2605.24305#bib.bib1)) 引入了621个问题的基准测试;我们将其规模扩大了两个数量级。

## 3 基准测试设计

### 3.1 本体论

该基准测试基于一个一阶逻辑本体论,包含27个一元谓词,分为三个层级:11个核心谓词,描述动态状态(混沌、确定性、正李雅普诺夫指数、敏感依赖、奇怪吸引子、点不可预测、统计可预测、准周期、随机、不动点吸引子、周期);4个拓扑谓词(耗散、有界、混合、遍历);以及12个结构谓词(超混沌、保守、连续时间、离散时间等)。

这些谓词通过78条有向公理边(31条蕴含,47条排他)相互连接,支持最多5-6跳的推理链。例如,混沌谓词蕴含:

∀s:Chaotic(s) ⇒ Deterministic(s) ∧ PosLyap(s) ∧ Sensitive(s) ∧ Mixing(s) ∧ ¬Random(s) ∧ ¬Periodic(s) ∧ ¬QuasiPeriodic(s) (1)

完整规范见附录F (https://arxiv.org/html/2605.24305#A6)。

### 3.2 系统

该基准测试覆盖165个动态系统:30个人工整理的系统(Lorenz-63 (Lorenz,1963 (https://arxiv.org/html/2605.24305#bib.bib15))、Rössler、Hénon、逻辑斯蒂映射、Brusselator、Ornstein-Uhlenbeck等)以及135个来自dyst (Gilpin,2021 (https://arxiv.org/html/2605.24305#bib.bib19)) 库的系统。每个系统都带有所有27个谓词的真实标签,并对照公理系统进行了验证。

### 3.3 任务家族

表1:按难度排列的任务家族数据集组成。N<100N<100 的家族进行定性解释。多跳问题通过公理图链式推理2-6步(例如,“FluidTrampoline是强混合的 ⇒ 弱混合 ⇒ 遍历 ⇒ 有界。它是有界的吗?”)。状态转变问题需要特定的分岔阈值(例如,“在 α=15.6 时,Chua电路是混沌的吗?”)。FOL推理问题给出前提,要求演绎结论。对抗性问题包含误导性但无关的前提。指标诊断问题需要解释数值混沌指标(0-1检验 (Gottwald and Melbourne,2009 (https://arxiv.org/html/2605.24305#bib.bib17))、排列熵 (Bandt and Pompe,2002 (https://arxiv.org/html/2605.24305#bib.bib18))、MEGNO (Cincotta and Simó,2000 (https://arxiv.org/html/2605.24305#bib.bib23)))。带模型预测的代表性示例见附录E (https://arxiv.org/html/2605.24305#A5)。

### 3.4 评估协议:CARE

二元分类基准测试中的标准准确率可能具有误导性。由于 Acc = p · TPR + (1-p) · TNR,其中 p 是真实阳性率,具有高TNR但低TPR的模型可以通过利用类别先验来抬高准确率。LLaMA 3.1-8B 说明了这一点:其 TPR = 0.32,TNR = 0.88,得到60.2%的准确率(而始终预测假为50.5%),但 MCC = 0.24 和平衡准确率 = 0.60 正确指示了接近随机的性能。为了揭示此类病理现象,我们提出 CARE(校准性和对抗鲁棒性评估)协议,用于推理基准测试。

CARE 报告五个诊断指标:

1. 1\.MCC(主要指标)(Matthews,1975 (https://arxiv.org/html/2605.24305#bib.bib13); Chicco and Jurman,2020 (https://arxiv.org/html/2605.24305#bib.bib16)):惩罚先验崩溃,对类别平衡不敏感。范围从 -1(反相关)到 0(随机)再到 +1(完美):MCC = (TP·TN - FP·FN) / sqrt((TP+FP)(TP+FN)(TN+FP)(TN+FN)) (2)
2. 2\.宏观家族MCC:跨任务家族的MCC均值,防止主导家族(原子:占问题的62%)掩盖困难家族的失败。
3. 3\.校准性:预测为真的比率与真实为真的比率。揭示先验崩溃(例如,LLaMA 3.1-8B 仅21.6%预测为真,而真实为49.5%)。
4. 4\.一致性:在一致性_释义和扰动家族上的MCC,衡量预测是否能抵御表面层次的变化。
5. 5\.覆盖率:无效率(无法解析的响应计为错误)和按家族的覆盖率,揭示指令遵循失败。

表2 (https://arxiv.org/html/2605.24305#S3.T2) 展示了CARE在四个模型上的应用。准确率将LLaMA 3.1-8B排为60.2%(高于随机),但CARE标记了先验崩溃(21.6%预测为真 vs. 49.5%真实)和非对称召回率(TPR = 0.32, TNR = 0.88):该模型通过默认为假而不是通过推理获得了准确率。Mistral-7B的61.3%准确率掩盖了1.1%的无效率和低于0.30的一致性MCC。只有Claude Sonnet 4.6没有触发CARE的标记。

表 2:四个模型的 CARE 诊断。标记:pc = 先验崩溃 (|pred TRUE% - 49.5| > 10);ar = 非对称召回 (|TPR - TNR| > 0.3);cv = 覆盖率 ( > 0.5% 无效);ic = 不一致 (一致性 MCC < 0.30)。所有标准模型使用温度 = 0;推理模型 (o3-mini, GPT-5.2) 不接受温度参数,设计为确定性(附录I (https://arxiv.org/html/2605.24305#A9))。大多数模型设置 max_tokens = 16;推理模型和 Gemini 使用 1024,因为它们的架构消耗输出令牌进行内部推理。

## 4 实验

我们评估了14个模型:7个专有模型(Claude Sonnet 4.6, GPT-5.2, GPT-4o, GPT-4o-mini, o3-mini, Gemini 2.5 Flash, DeepSeek-Chat)和7个开源模型(Qwen 2.5-{7B,14B,32B}, LLaMA 3.3-70B, LLaMA 3.1-8B, Gemma2-9B, Mistral-7B),通过Ollama提供服务。十个模型完成了完整数据集 (N = 40,886);四个由于计算限制使用了子集(5k或1k),在单独的表格中报告,以避免跨 N 排名。

## 5 结果

### 5.1 总体性能

表3:完整规范 (N = 40,886),按MCC排名。Claude Sonnet 4.6 以 MCC = 0.601 领先(表3 (https://arxiv.org/html/2605.24305#S5.T3))。专有与开源之间的差距为0.12 MCC,但 Qwen 2.5-32B (0.478) 表现优于 GPT-4o (0.450) 和 Gemini 2.5 Flash (0.458)。子集评估(o3-mini MCC = 0.608 on 5k;Gemma2-9B 0.280 on 5k;GPT-4o-mini 0.272 on 1k;Qwen 2.5-7B 0.268 on 1k)在附录A (https://arxiv.org/html/2605.24305#A1) 中报告。

### 5.2 任务家族难度

参见说明图1:10个完整规范模型的按家族MCC均值。误差条:最小值-最大值。图1 (https://arxiv.org/html/2605.24305#S5.F1) 按MCC均值排列家族。简单 (MCC > 0.5):扩展系统 (0.81, 天花板效应)、指标诊断 (0.59)、FOL推理 (0.52)。中等 (0.25–0.5):多跳 (0.48)、对抗性家族 (0.44–0.45)、原子 (0.32)。困难 (< 0.25):扰动 (0.26)、一致性_释义 (0.25)、交叉指标 (0.18)、状态转变 (0.05)。状态转变对所有模型几乎都是随机的:这些问题需要特定的分岔阈值(例如,逻辑斯蒂映射在 r≈3.57),无法从逻辑规则中恢复。

### 5.3 按模型家族分析

参见说明图2:10个模型的按家族MCC。家族按难度排列(最左 = 最难)。红色单元格表示负MCC(反相关)。图2 (https://arxiv.org/html/2605.24305#S5.F2) 揭示,家族层面的性能并不随总体MCC单调变化。Qwen 2.5-32B 在指标诊断上达到 MCC = 0.91(超过GPT-4o的0.89和Claude Sonnet的0.45),而Claude Sonnet在多跳 (0.64) 和原子 (0.62) 上领先。LLaMA 3.1-8B 在扩展系统(45个事实回忆问题,天花板效应)上得分完美,但在交叉指标上接近零。

两个模型在状态转变上产生了负MCC:LLaMA 3.3-70B (−0.17; TP = 9, FP = 17, TN = 20, FN = 22; 平衡准确率0.42) 和 Mistral-7B (−0.10)。负MCC意味系统性的反相关:这些模型已经学到了在分岔问题上总是出错的启发式方法。混淆矩阵见附录G (https://arxiv.org/html/2605.24305#A7)。

### 5.4 专有优势集中的领域

参见说明图3:按家族 ΔMCC (Claude Sonnet 4.6 - Qwen 2.5-32B)。绿色:Sonnet领先。红色:Qwen领先。0.12的总体差距并不均匀(图3 (https://arxiv.org/html/2605.24305#S5.F3))。Sonnet的优势集中在交叉指标 (Δ = +0.40)、一致性_释义 (+0.22) 和状态转变 (+0.19):这些家族需要整合定量信号或对表面变化的鲁棒性。在扰动 (0.00)、多跳 (+0.01)、FOL推理 (-0.01) 上接近持平。Qwen 2.5-32B 在指标诊断上遥遥领先 (-0.46)。

### 5.5 预测偏差

参见说明图4:预测为真的比率 vs. 真实为真的比率 (49.5%)。LLaMA 3.1-8B 仅21.6%预测为真。真实阳性率为49.5%。大多数模型预测为真的比率在42-50%之间,但LLaMA 3.1-8B仅21.6% (TNR = 0.88, TPR = 0.32),这解释了尽管平衡准确率适中但其MCC较低的原因。Mistral-7B 显示相反情况:56.2%预测为真(图4 (https://arxiv.org/html/2605.24305#S5.F4))。

## 6 讨论

#### 知识类型的边界。

核心发现是两种推理类型之间的分离。FOL推理 (MCC = 0.52) 测试模型在明确给出前提时能否应用演绎规则;状态转变 (MCC = 0.05) 测试模型本身能否提供数值前提(例如,逻辑斯蒂映射在 r≈3.57 时转变为混沌)。这不是一个规模问题:在 Qwen 2.5 系列中,参数从7B增加到32B改善了多跳和FOL推理,但状态转变仍接近随机(附录B (htt

相似文章

对概率算子进行逻辑推理的LLM能力基准测试

arXiv cs.CL

本文介绍了一个包含14,320个程序化生成提示词的基准测试,用于评估LLM在涉及“probably”“might”“must”等概率算子的逻辑推理上的表现。作者对29个模型进行了测试,发现了系统性的答案偏差,并表明只有9个模型的表现超过了随机水平。

大语言模型何时进行推理?基于熵相变的动力系统视角

arXiv cs.LG

本文探讨了思维链推理在何时对大语言模型有益,表明早期熵动力学能够可靠地指示推理效用,并介绍了EDRM,这是一个轻量级、无需训练的框架,可自适应选择推理策略,在保持或提升准确率的同时显著节省token。