棋盘上的幻觉:工具增强的LLM国际象棋评论评估

arXiv cs.CL 论文

摘要

本文介绍了ACT-Eval,一个用于LLM国际象棋评论的工具增强评估框架,并发布了包含325个局面-走法对的基准数据集。研究发现,事实性幻觉在LLM国际象棋评论中仍然普遍存在,而工具增强能够提高事实正确性,但并未提升专家级战略覆盖度。

arXiv:2608.04240v1 公告类型:新 摘要:在国际象棋等领域,超人级别的游戏引擎使得专家级评估变得易于获取,但它们传达的是事实,而没有自然语言解释,而这些解释对于专家和非专家来说都具有教育价值。大语言模型原则上可以弥合这一差距,但由于领域特定知识有限,它们经常产生幻觉,而标准的基于参考或LLM作为评判者的框架无法可靠地检测这些错误。在这项工作中,我们提出了ACT-Eval,一个评估框架,它将国际象棋评论分解为原子声明,并将其路由到引擎支持的工具和专家标注的黄金参考,以评估事实正确性、概念覆盖度和走法质量判断。我们发布了一个包含325个局面-走法对的基准数据集,涵盖教学、锦标赛和关键局面,其中125个局面具有专家验证的黄金原子和五类错误分类法。在评估领先的专有和开放权重模型时,我们发现事实性幻觉在国际象棋评论中仍然普遍存在:没有工具辅助的GPT-5.4在22.0%的情况下产生错误子声明,而较小的开放权重模型则超过40%。尽管工具增强显著提高了事实正确性和走法质量评估,但所有模型对专家战略和技术思想的覆盖仍然有限。人工校准表明,ACT-Eval的事实判断处于观察到的人类间一致范围之内,而其覆盖分数与人类对战略完整性的评估密切相关。
查看原文
查看缓存全文

缓存时间: 2026/08/06 07:45

# 工具增强的LLM国际象棋评论评估
来源:https://arxiv.org/html/2608.04240
## 棋盘上的幻觉:工具增强的LLM国际象棋评论评估
S\. Ashwin Hebbar 普林斯顿大学 & Peiyao Sheng Sentient Labs & Sewoong Oh 华盛顿大学 & Pramod Viswanath 普林斯顿大学

###### 摘要
国际象棋等领域的超人游戏引擎使得专家级评估变得易于获取,但它们传达的是事实本身,而缺乏自然语言解释,而正是这些解释使此类专业知识对专家和非专家都具有教育意义。大语言模型原则上可以弥合这一差距,但由于领域特定知识有限,它们经常产生幻觉,而标准的基于参考或LLM作为评判者的框架无法可靠地检测这些错误。在这项工作中,我们提出了ACT-Eval,一个评估框架,它将国际象棋评论分解为原子化主张,并将其路由到引擎支持的工具和专家标注的金标准参考,以评估事实正确性、概念覆盖率和走法质量判断。我们发布了一个包含325个局面-走法对的基准,涵盖教学、锦标赛和关键局面,其中125个局面带有专家验证的金标准原子和五类错误分类法。对领先的专有和开放权重模型的评估发现,国际象棋评论中的事实幻觉仍然普遍存在:没有工具的GPT-5\.4错误子主张出现率为22\.0%,而较小的开放权重模型超过40%。尽管工具增强显著提高了事实正确性和走法质量评估,但所有模型对专家战略和战术想法的覆盖率仍然有限。人工校准表明,ACT-Eval的事实判断落在观察到的人工间一致性范围内,而其覆盖率分数与人类对战略完整性的评估密切相关。

棋盘上的幻觉:工具增强的LLM国际象棋评论评估
S\. Ashwin Hebbar 普林斯顿大学
Peiyao Sheng Sentient Labs
Sewoong Oh 华盛顿大学
Pramod Viswanath 普林斯顿大学

## 1 引言
国际象棋长期以来一直是研究战略推理的经典领域。其吸引力不仅在于游戏的组合复杂性,还在于围绕它发展起来的丰富解释传统。几个世纪以来,国际象棋的理解通过注释对局、书籍、讲座、广播以及最近的YouTube和Twitch等在线平台来传播。高手通过将走法转化为计划、威胁、战术主题和长期权衡来使走法易于理解。这些形式的持久流行反映了一个简单的事实:棋手和观众不仅想知道哪一步最好,还想知道为什么有效。

Stockfish(2024 (https://arxiv.org/html/2608.04240#bib.bib24));Silver等人(2016 (https://arxiv.org/html/2608.04240#bib.bib25))等超人引擎通过使专家级评估广泛可及,改变了这一格局。一方面,这为专业知识的大众化创造了前所未有的机会:即使是新手也可以咨询引擎,立即知道一步棋是失误还是妙手。然而,引擎只提供一个客观分数,对于初学者和中级棋手来说,这个分数的意义可能仅限于判断谁更好;即使是精英特级大师的准备也涉及花费数小时将引擎走法转化为人类解释和实际计划。引擎在很大程度上解决了找到强手的问题,但没有解决解释它们的问题。

参见标题
图1:GCC-Eval与ACT-Eval对生成的国际象棋评论的比较。此示例中的评论流畅,但不对应实际的国际象棋局面。然而,朴素的LLM评判者GCC-Eval给出了近乎完美的相关性和完整性分数。ACT-Eval则将评论分解为原子化主张,使用象棋工具和引擎分析验证事实主张,并对照专家参考原子衡量覆盖率。在这里,它正确判断出三个事实主张中只有一个正确,并且没有一个关键专家想法被覆盖。

大语言模型(LLM)的快速发展提供了一个有前景的方向。LLM在许多领域擅长多步推理(Wei等人 (2022 (https://arxiv.org/html/2608.04240#bib.bib26));OpenAI (2024 (https://arxiv.org/html/2608.04240#bib.bib27))),并能生成人类可以理解的自然语言推理轨迹。这为弥合超人专业知识与教育性解释之间的差距创造了可能性。然而,在LLM能够可靠地在领域特定推理任务中发挥这一作用之前,仍然存在重大挑战。以国际象棋为例,即使是最先进的研究型LLM在国际象棋特定推理上的表现也远低于人类专家棋手,更不用说专门的引擎了(Kolasani等人 (2025 (https://arxiv.org/html/2608.04240#bib.bib30));Wen等人 (2025 (https://arxiv.org/html/2608.04240#bib.bib23)))。此外,国际象棋的空间结构和长时域时间复杂性放大了幻觉问题:模型经常错误识别棋子位置、威胁或提出非法的走法序列,我们在第6\.1节 (https://arxiv.org/html/2608.04240#S6.SS1)中量化了这种模式,导致评论常常听起来合理却包含事实错误(图1 (https://arxiv.org/html/2608.04240#S1.F1))。

与这些生成挑战叠加的是一个基本的评估问题:目前没有可靠的方法来衡量语言模型对国际象棋等特定领域的理解程度,或者它对一步棋的解释有多准确。现有基准主要关注可验证的能力,如解谜准确率和Elo式下棋强度(Kolasani等人 (2025 (https://arxiv.org/html/2608.04240#bib.bib30));Wen等人 (2025 (https://arxiv.org/html/2608.04240#bib.bib23)))。标准文本生成指标(Papineni等人 (2002 (https://arxiv.org/html/2608.04240#bib.bib15));Lin (2004 (https://arxiv.org/html/2608.04240#bib.bib16)))仅衡量与参考评论的表面相似性。最近的LLM作为评判者方法(Liu等人 (2023 (https://arxiv.org/html/2608.04240#bib.bib21));Kim等人 (2025 (https://arxiv.org/html/2608.04240#bib.bib12)))使用大语言模型来评估解释,引入了一个循环问题:评判者与被评估模型存在相同的领域特定弱点(Szymanski等人,2025 (https://arxiv.org/html/2608.04240#bib.bib22)),使其成为领域特定事实的不可靠仲裁者。如图1 (https://arxiv.org/html/2608.04240#S1.F1)所示,一段幻觉评论在GCC-Eval(Kim等人 (2025 (https://arxiv.org/html/2608.04240#bib.bib12)))下获得4\.9/5分,但三个主要主张中有两个包含事实错误。

在这项工作中,我们着手解决这一差距,提出一个评估框架,用于评估LLM在领域特定推理任务中的理解和可解释性,并以国际象棋作为测试平台。国际象棋的一个关键特性是,许多事实主张,如走法合法性、攻击、子力平衡或棋盘状态,可以通过象棋引擎和符号工具确定性检查(Stockfish (2024 (https://arxiv.org/html/2608.04240#bib.bib24));Leela Chess Zero (2026 (https://arxiv.org/html/2608.04240#bib.bib31));Fiekas (2022 (https://arxiv.org/html/2608.04240#bib.bib29))),而关于计划、协调或局面性想法的更高层次解释则不能完全简化为计算。基于这一观察,我们提出了ACT-Eval(原子化和工具增强评估),一个用于评估国际象棋评论的原子化、工具增强框架。ACT-Eval将评论分解为原子主张,并使用LLM将每个主张路由到确定性工具以检查事实正确性。此外,LLM评判者评估战略性和解释性主张,通过对照专家标注的金标准参考的原子召回率来衡量覆盖率,捕捉解释是否识别了强棋手会认识到的关键想法。

我们的贡献总结如下:
- •我们引入了ACT-Eval,一个将原子主张分解与工具增强验证相结合的象棋评论评估框架。通过将计算可判定的主张路由到引擎和棋盘状态预言机,ACT-Eval在适用计算检查的地方将评判者锚定在确定性棋盘状态和引擎证据上,减少了对评判者参数化象棋知识的依赖。
- •我们构建了一个包含325个局面-走法对的基准,涵盖教学教科书、现代锦标赛和精心设计的关键局面。该基准的核心是一个带有专家验证金原子的局面子集,这些原子来源于特级大师级别的人类注释。它们作为评估概念覆盖率的参考——生成的评论是否捕捉了走法背后的战略和战术见解——作为事实正确性的补充维度。
- •我们评估了前沿和开放权重LLM,发现事实幻觉在国际象棋评论中仍然普遍存在,特别是在战术变化和长走法序列中。我们发现,没有引擎访问权限的模型无法可靠地区分好棋和错误。工具增强显著提高了事实正确性,但对照专家注释的原子召回率仍然有限。人工校准研究进一步表明,ACT-Eval与专家标注者的一致性在人工间一致性范围内。以国际象棋作为领域特定解释的测试平台,我们表明当前的前沿LLM未能将其强大的通用推理转化为可靠的领域特定专业知识,这些结果表明其他专业领域可能出现类似的评估差距。广泛地说,ACT-Eval为部分事实可通过计算验证、其余部分可锚定于专家标注的领域提供了一个候选方法论模板。

我们发布了框架和基准¹¹¹https://github.com/hebbarashwin/act_eval

## 2 相关工作
对生成文本的可靠评估已经从三个方向进行了探讨:与人类参考的相似性(Papineni等人 (2002 (https://arxiv.org/html/2608.04240#bib.bib15));Lin (2004 (https://arxiv.org/html/2608.04240#bib.bib16));Zhang等人 (2019 (https://arxiv.org/html/2608.04240#bib.bib17)))、对照知识来源的事实验证(Min等人 (2023b (https://arxiv.org/html/2608.04240#bib.bib42));Chern等人 (2023 (https://arxiv.org/html/2608.04240#bib.bib14));Wei等人 (2024 (https://arxiv.org/html/2608.04240#bib.bib13))),以及LLM作为评判者的评分(Liu等人 (2023 (https://arxiv.org/html/2608.04240#bib.bib21)))。对于像国际象棋这样的领域特定文本生成,每种方法都有不同的失效原因。

相似性指标奖励流畅的文本,而不考虑正确性(Kryściński等人,2020 (https://arxiv.org/html/2608.04240#bib.bib18);Falke等人,2019 (https://arxiv.org/html/2608.04240#bib.bib40);Maynez等人,2020 (https://arxiv.org/html/2608.04240#bib.bib41))。事实性方法假设主张可以通过检索来验证,但验证国际象棋主张需要针对当前局面进行计算,而不是对照知识库进行检索。验证单个国际象棋主张可能需要选择正确的局面、模拟一个变化、检查合法性和攻击,并将这些与引擎评估组合——这是对演变的棋盘状态的计算,而不是查找,这与围绕检索构建的分解-验证框架不同(Min等人,2023b (https://arxiv.org/html/2608.04240#bib.bib42);Chern等人,2023 (https://arxiv.org/html/2608.04240#bib.bib14);Wei等人,2024 (https://arxiv.org/html/2608.04240#bib.bib13))。LLM评判者在需要专家知识的领域会急剧退化(Szymanski等人,2025 (https://arxiv.org/html/2608.04240#bib.bib22)),而没有可靠象棋知识的评判者无法检测流畅但错误的象棋主张。

在我们设置中最近的相关工作GCC-Eval(Kim等人 (2025 (https://arxiv.org/html/2608.04240#bib.bib12)))用参考评论和引擎分析增强了LLM评判者,但继承了有噪声的参考和未解释的引擎分数。ACT-Eval通过将事实主张路由到确定性象棋工具并对照专家验证的金标准原子评分概念覆盖率来解决这些局限性;我们在附录E (https://arxiv.org/html/2608.04240#A5)中提供了扩展讨论。

## 3 ACT-Eval框架
参见标题
图2:ACT-Eval流水线概述。参考评论被过滤并分解为专家验证的金标准原子,而生成的评论被分解为候选原子。评判者使用象棋特定的棋盘状态和引擎工具验证可工具检查的候选主张,将验证的候选与金标准原子匹配,并计算事实精确率、原子召回率和走法质量F1。这些指标操作化了第3\.1节中引入的三个维度:事实精确率衡量可验证的事实正确性,原子召回率衡量相对于金标准注释的覆盖率,走法质量F1衡量对引擎标记的错误和失误的检测。

### 3\.1 背景
#### 国际象棋评论评估。
我们考虑评估国际象棋走法评论质量的任务。形式上,给定一个以标准编码(FEN或ASCII)表示的棋盘状态\(s\)和在该状态下走的走法\(a\),评论\(\mathcal{C}\)是用自然语言解释该走法的战略或战术目的。我们的目标是沿着三个维度评估\(\mathcal{C}\)的质量:
(1) 事实正确性——\(\mathcal{C}\)中关于当前或后续状态的主张应该相对于棋盘状态在事实上正确。例如,关于棋子位置、攻击、威胁、将军、吃子、合法走法和结果局面的主张应该相对于\(s\)和\(a\)是正确的;
(2) 走法质量判断——\(\mathcal{C}\)应该正确描述走法\(a\)的质量,例如,区分强局面选择与不准确或失误;
(3) 概念覆盖率——\(\mathcal{C}\)应该识别人类专家认为在局面中最突出的关键战略和战术主题。

#### 为什么评估很困难。
评估评论是否满足这些属性并非易事。现有的基于参考、LLM作为评判者的方法(Kim等人 (2025 (https://arxiv.org/html/2608.04240#bib.bib12)))存在两个主要局限性。首先,评判者依赖的参考数据往往有噪声,包含风格伪影和不完整的分析。其次,更关键的是,LLM评判者对事实错误不敏感:一个流畅、象棋特定但*错误*的主张会获得高分,因为评判者缺乏检测错误所需的象棋知识(见第4\.3节 (https://arxiv.org/html/2608.04240#S4.SS3))。为了解决这些局限性,我们提出了ACT-Eval(原子化和工具增强评估),一个结合原子化专家标注作为金标准参考和工具增强事实验证以大幅减少LLM幻觉的框架。

### 3\.2 金标准原子提取
我们从经典象棋书籍和注释在线研究收集参考评论。由于来源质量参差不齐,我们应用正则表达式过滤器去除裸走法符号、单词评估和通用填充,然后使用带少量示例演示的LLM将剩余内容分解为金标准原子:离散的、局面特定的事实陈述。每个原子都有上下文——

相似文章

基准是否低估了 LLM 的性能?采用以大语言模型为先、人工仲裁的评估方法评估幻觉检测

arXiv cs.CL

本文通过采用以大语言模型为先、人工仲裁的评估方法重新评估幻觉检测数据集,研究了标准基准是否低估了大语言模型(LLM)的性能。研究发现,在仲裁过程中融入大语言模型的推理能力可以提高评估的一致性,并表明针对容易产生歧义的任务,采用模型辅助的重新评估能产生更可靠的基准。

PARALLAX: 区分真实幻觉检测与基准构建伪影

arXiv cs.CL

本文揭示了LLM幻觉检测领域报道的许多进展实际上源于基准构建伪影,其中真实答案被嵌入到提示中,使得简单的文本相似度基线方法能够获得近乎完美的分数。通过大规模受控评估,作者证明,在适当控制下,大多数方法的表现接近随机水平,除了对上层隐藏状态的监督探针(如SAPLMA)以及他们提出的DRIFT。

HalluScore:大语言模型幻觉问答基准

arXiv cs.CL

介绍HalluScore,一个结构化的阿拉伯语问答基准,用于评估大语言模型在不同推理难度、知识领域和文化背景下的幻觉。包含827个带有验证证据和注释的问题,已在17个大语言模型上测试。