ChLogic: 评估中文表达中逻辑推理的鲁棒性
摘要
介绍ChLogic,这是一个英汉对齐的基准测试,用于检验大型语言模型在不同语言间是否保持逻辑推理性能,揭示了持续存在的差距,这些差距受到表面实现和翻译痕迹的影响。
查看缓存全文
缓存时间: 2026/06/17 03:35
Paper page - ChLogic: Evaluating Robustness of Logical Reasoning in Chinese Expressions
来源: https://huggingface.co/papers/2606.17905
摘要
ChLogic 基准揭示了大型语言模型在英文和中文逻辑推理之间持续存在的性能差距,这种差距受到表面实现差异和翻译伪影的影响。
大型语言模型 (https://huggingface.co/papers?q=Large%20language%20models) 在标准逻辑推理基准 (https://huggingface.co/papers?q=logical%20reasoning%20benchmarks) 上的表现越来越好,但这种能力在英文之外是否依然稳健尚不清楚。我们引入了 ChLogic,这是一个英中对齐的基准,用于测试当相同的潜在逻辑结构以英文和多种中文表面实现 (https://huggingface.co/papers?q=surface%20realization) 表达时,模型是否能保持逻辑推理性能。该基准基于形式逻辑模板构建,包含三个数据集:(i) 通用对齐集,源自跨九个模板家族的 60 个通用命题;(ii) 困难对齐集,源自 40 个困难问题;以及 (iii) 纯中文集,涵盖 15 种语言特有现象类型。每个对齐条目将一个英文参考表达式与五个中文实现配对。在 Qwen3、Ministral 和 GLM 模型上的实验揭示了持续的英中性能差距。从标准中文回译 (https://huggingface.co/papers?q=Back-translation) 为英文通常能在通用对齐集上提升性能,但在困难对齐集上产生混合效果,Qwen3-32B 和 GLM-5.1 在翻译后表现更差。这些结果表明,中文表面实现 (https://huggingface.co/papers?q=surface%20realization)、翻译伪影以及模型特定行为共同影响了多语言逻辑推理。总体而言,ChLogic 为多语言推理 (https://huggingface.co/papers?q=multilingual%20reasoning) 的稳健性提供了一个有用的压力测试。
查看 arXiv 页面 (https://arxiv.org/abs/2606.17905)查看 PDF (https://arxiv.org/pdf/2606.17905)GitHub (https://github.com/0328zpx/ChLogic)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.17905)
在您的 agent 中获取此论文:
hf papers read 2606.17905
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2606.17905 以从此页面链接。
引用此论文的数据集0
没有数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.17905 以从此页面链接。
引用此论文的 Spaces0
没有 Space 链接到此论文
在 Space README.md 中引用 arxiv.org/abs/2606.17905 以从此页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
LLMEval-Logic:一个经过求解器验证的、带有对抗性加固的大语言模型逻辑推理中文基准
LLMEval-Logic 是一个新的中文基准,专门评估大语言模型的逻辑推理能力,具有求解器验证的答案和对抗性加固。该基准揭示了当前模型的显著差距,最佳模型在困难项目上仅达到37.5%的准确率。
ChaosBench-Logic v2:大规模评估LLM在动态系统上的逻辑推理能力
ChaosBench-Logic v2是一个包含165个动态系统共40,886个问题的大规模基准测试,用于评估LLM的逻辑推理能力,结果显示即使在最前沿的模型中,在状态转变推理上也接近随机表现,并存在系统性失败模式。
推理大语言模型中的隐藏语言一致性现象
本文研究多语言推理模型,揭示输出中的语言一致性可能随任务难度增加而退化或崩溃,尤其是对于资源较少的语言。文章认为,评估多语言能力需要同时考虑准确性、语言一致性和任务难度。
探索大语言模型在中文抽象语言掌握中的能力边界
本文介绍了Mouse基准测试,用于评估大语言模型在六个自然语言处理领域的中文抽象语言任务表现。研究表明,尽管当前最先进的模型在上下文理解任务中表现良好,但在这种亚文化网络语言上仍存在重大局限。
评估大型语言模型中的中文歧义理解能力
本文介绍了基于潜在歧义理论的汉语歧义数据集CHA-Gen,并评估了多个LLM在歧义检测任务上的表现。研究发现,模型虽然面临挑战,但通过思维链提示有所改进,而指令调优则导致过度自信。