ChLogic: 评估中文表达中逻辑推理的鲁棒性

Hugging Face Daily Papers 论文

摘要

介绍ChLogic,这是一个英汉对齐的基准测试,用于检验大型语言模型在不同语言间是否保持逻辑推理性能,揭示了持续存在的差距,这些差距受到表面实现和翻译痕迹的影响。

大型语言模型在标准化逻辑推理基准测试上表现越来越好,但这种能力在英语之外的语言中是否依然稳健尚不清楚。我们提出了ChLogic,一个英汉对齐的基准测试,用于检验模型在相同的潜在逻辑结构以英语和多种中文表面实现表达时,是否保持逻辑推理性能。该基准测试基于形式逻辑模板构建,包含三个数据集:(i)通用对齐集,源自60个通用命题,覆盖九个模板系列;(ii)困难对齐集,源自40个困难问题;(iii)仅中文集,涵盖15种语言特定现象类型。每个对齐条目将一条英语参考表达式与五种中文实现配对。在Qwen3、Ministral和GLM模型上的实验揭示了持续的英汉性能差距。从标准中文回译成英语通常能提升通用对齐集上的性能,但在困难对齐集上效果不一,Qwen3-32B和GLM-5.1在翻译后表现更差。这些结果表明,中文表面实现、翻译痕迹以及模型特定行为共同影响多语言逻辑推理。总体而言,ChLogic为多语言推理的鲁棒性提供了一个有用的压力测试。
查看原文
查看缓存全文

缓存时间: 2026/06/17 03:35

Paper page - ChLogic: Evaluating Robustness of Logical Reasoning in Chinese Expressions

来源: https://huggingface.co/papers/2606.17905

摘要

ChLogic 基准揭示了大型语言模型在英文和中文逻辑推理之间持续存在的性能差距,这种差距受到表面实现差异和翻译伪影的影响。

大型语言模型 (https://huggingface.co/papers?q=Large%20language%20models) 在标准逻辑推理基准 (https://huggingface.co/papers?q=logical%20reasoning%20benchmarks) 上的表现越来越好,但这种能力在英文之外是否依然稳健尚不清楚。我们引入了 ChLogic,这是一个英中对齐的基准,用于测试当相同的潜在逻辑结构以英文和多种中文表面实现 (https://huggingface.co/papers?q=surface%20realization) 表达时,模型是否能保持逻辑推理性能。该基准基于形式逻辑模板构建,包含三个数据集:(i) 通用对齐集,源自跨九个模板家族的 60 个通用命题;(ii) 困难对齐集,源自 40 个困难问题;以及 (iii) 纯中文集,涵盖 15 种语言特有现象类型。每个对齐条目将一个英文参考表达式与五个中文实现配对。在 Qwen3、Ministral 和 GLM 模型上的实验揭示了持续的英中性能差距。从标准中文回译 (https://huggingface.co/papers?q=Back-translation) 为英文通常能在通用对齐集上提升性能,但在困难对齐集上产生混合效果,Qwen3-32B 和 GLM-5.1 在翻译后表现更差。这些结果表明,中文表面实现 (https://huggingface.co/papers?q=surface%20realization)、翻译伪影以及模型特定行为共同影响了多语言逻辑推理。总体而言,ChLogic 为多语言推理 (https://huggingface.co/papers?q=multilingual%20reasoning) 的稳健性提供了一个有用的压力测试。

查看 arXiv 页面 (https://arxiv.org/abs/2606.17905)查看 PDF (https://arxiv.org/pdf/2606.17905)GitHub (https://github.com/0328zpx/ChLogic)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.17905)

在您的 agent 中获取此论文:

hf papers read 2606.17905

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2606.17905 以从此页面链接。

引用此论文的数据集0

没有数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.17905 以从此页面链接。

引用此论文的 Spaces0

没有 Space 链接到此论文

在 Space README.md 中引用 arxiv.org/abs/2606.17905 以从此页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

推理大语言模型中的隐藏语言一致性现象

arXiv cs.CL

本文研究多语言推理模型,揭示输出中的语言一致性可能随任务难度增加而退化或崩溃,尤其是对于资源较少的语言。文章认为,评估多语言能力需要同时考虑准确性、语言一致性和任务难度。

探索大语言模型在中文抽象语言掌握中的能力边界

arXiv cs.CL

本文介绍了Mouse基准测试,用于评估大语言模型在六个自然语言处理领域的中文抽象语言任务表现。研究表明,尽管当前最先进的模型在上下文理解任务中表现良好,但在这种亚文化网络语言上仍存在重大局限。

评估大型语言模型中的中文歧义理解能力

arXiv cs.CL

本文介绍了基于潜在歧义理论的汉语歧义数据集CHA-Gen,并评估了多个LLM在歧义检测任务上的表现。研究发现,模型虽然面临挑战,但通过思维链提示有所改进,而指令调优则导致过度自信。