IOL-AI 挑战赛:迈向语言推理进步的开放挑战
摘要
IOL-AI 挑战赛是一项开源科学竞赛,利用国际语言学奥林匹克竞赛2026年的未公开题目来评估AI模型的语言推理能力,结果表明性能更依赖于解码和输出处理而非模型规模。
arXiv:2608.18011v1 公告类型:新
摘要:对大语言模型推理能力的研究绝大多数集中在提供明确规则的领域:数学和代码。语言谜题则相反:解题者必须首先发现系统规则,然后才能在其中进行推理。我们推出 IOL-AI 挑战赛,这是一项基于国际语言学奥林匹克竞赛个人赛2026年未公开题目举办的开源科学竞赛,既采用自动评估,也首次由国际语言学奥林匹克竞赛官方评审团成员按照评估人类参赛者的相同标准进行评审。该挑战赛在严格的算力预算(一块T4显卡,30分钟)内,共收到来自46支团队的731份提交作品。我们还对15个无限制的前沿模型和开源模型进行了基准测试,其中 Claude Opus 4.8 获得了相当于金牌的评审团评分,而我们提交进行评审评分的两个受资源限制的系统,其得分均处于参赛者最后5%的范围内。能力并不由规模决定:140亿参数的提交作品在表现上优于规模两倍于此的模型,性能提升主要来自解码和输出处理而非模型容量。我们还发现,自动评估指标对系统的排名与评审团完全一致,但评分尺度被压缩:弱系统被高估约13分,而强系统则被低估。我们的分析表明,尽管前沿模型可能对某些问题语言拥有先验知识,但这并未显著帮助它们解决语言推理任务,因此语言推理仍可作为评估泛化推理能力的有力基准。
查看缓存全文
缓存时间: 2026/08/19 10:12
# IOL-AI 挑战赛:迈向语言推理新领域的公开挑战 来源:https://arxiv.org/html/2608.18011 作者 1 Rita Berrada(伦敦大学学院) 2,3 Dan-Mircea Mirea(麦吉尔大学 / Cohere Labs) 4 Sara Rajaee(普林斯顿大学) 5 Alexander Piperski(阿姆斯特丹大学) 6 Ana Meta Dolinar(斯德哥尔摩大学) 7 Boris Iomdin(人文科学学院) 8 Andrey Nikulin(戈亚斯联邦大学) 9 Mariya Shmatova(独立研究者) 3 Marzieh Fadaee(伦敦大学学院) 3 Julia Kreutzer(伦敦大学学院) ###### 摘要 当前对大语言模型(LLMs)推理能力的研究主要集中在数学和编程等具有明确规则的领域。而语言谜题恰好相反:求解者必须首先自行发现规则体系,才能在其中进行推理。我们提出 IOL-AI 挑战赛——这是一项基于国际语言学奥赛(IOL)2026 年个人赛未公开题目举办的开放科学竞赛,首次同时采用自动评分和 IOL 官方评审团评审,评审标准与人类参赛者完全一致。挑战赛在严格计算预算(单张 T4 显卡、30 分钟)下,共收到来自 46 个团队的 731 份提交。我们还对 15 个无限制前沿模型及开源模型进行了基准测试,其中 Claude Opus 4.8 获得了相当于金牌的评审团分数;而我们提交评审的两个资源受限系统得分均处于倒数 5% 参赛者区间。模型能力并非由规模决定:14B 参数模型的提交结果优于两倍体量的模型,性能提升来自解码与输出处理策略而非模型容量。我们还发现自动评估指标的排名与评审团完全一致,但分数分布更压缩——对弱系统高估约 13 分,对强系统则低估。分析表明,尽管前沿模型可能对某些问题语言拥有先验知识,但这并未显著帮助其解决语言推理任务,因此语言推理仍是评估通用推理能力的有效基准。 机构隶属 伦敦大学学院 | 麦吉尔大学 | 中央理工学院 | Cohere Labs | 普林斯顿大学 | 阿姆斯特丹大学 | 斯德哥尔摩大学 | 人文科学学院 | 戈亚斯联邦大学 | 独立研究者 ## 1 引言 推理已成为提升大语言模型能力的核心范式之一。现代系统不仅通过扩大模型规模、增加数据或延长预训练来改进性能,更常在推理时分配计算资源,生成中间推理步骤、探索替代路径、验证方案并修正答案。这些进展令人瞩目,但我们对推理的研究方式却依然狭窄。主流的推理测试集中在数学与编程——这些领域具有形式化结构、明确答案和大量可自动验证的反馈。然而,现实世界的问题往往并非始于清晰的规则体系。求解者可能首先需要推断出相关的结构框架。大多数推理基准测试抽象化了这一步骤:它们提供规则、形式体系或问题空间,评估系统在其中的推理能力。更根本的问题在于:一个系统能否从证据中推断出有用结构,并在该结构中进行推理?这种能力对泛化至关重要:解决陌生领域的新问题需要识别规律、形成假设并用新证据验证假设。自然语言为探索这一问题提供了极具吸引力的领域。人类语言是高度可变、不规则且依赖语境的复杂组合结构系统。语言谜题(有时称为“语言学谜题”)——这类谜题要求求解者基于有限语料库厘清陌生语言的语言现象——为检验这种能力提供了天然试验场。理解一门从未接触过的语言时,人们必须从稀疏观察中推断潜在结构:识别反复出现的单元、发现语法转换、形成意义假设,并用这些假设预测新形式。 大多数语言谜题源自语言学奥赛,其中规模最大的是国际语言学奥赛(IOL)。这项年度竞赛汇聚了来自多国(2026 年有 46 个参赛国)的中学生,通过解决语言谜题展开竞技。每道题挑战参赛者:(1) 分析来自一门或多门可能从未接触过的语言的数据,(2) 推导出能完全解释这些数据的规则集,(3) 运用这些规则在陌生语言中进行双向翻译。参赛者的解答由被称为 IOL 评审团的国际语言学家、通晓多语言者及往届 IOL 参赛者组成的团队进行评分,所有评审员都具有丰富的语言谜题设计与评估经验。既往研究一致表明,即使最先进的推理模型在此类谜题中也表现不佳。我们将过去的基准测试推进了三大步:(1) 组织开放科学社区,通过有时限和排行榜的挑战赛推动开源及资源受限模型的语言推理能力提升——即 IOL-AI 挑战赛;(2) 与 IOL 组织方合作,使用 2026 年 IOL 个人赛的全新未公开题目进行模型基准测试,彻底消除闭源模型的题目泄漏疑虑;(3) 获得 IOL 官方评审团的专家级人类评估,使我们能定位语言推理的专家级判断标准——此前我们仅能依赖自动匹配官方答案的浅层评估。因此,本研究构成了当前对大语言模型语言推理能力最全面、最深入的大规模评估。与既往工作不同,我们发现专有模型已接近任务要求,但开源模型仍差距显著,且在资源约束下大多任务失败——这表明通用推理能力仍是亟待解决的重大开放问题。 ## 2 相关工作 ### 推理能力评估 大型推理模型的推理能力评估已成为衡量其进步的AI基准核心原则。推理数据集涵盖广泛任务,包括但不限于数学与定理证明、代码生成、科学与跨学科领域以及视觉谜题。解决国际数学奥赛(IMO)——公认的最难度数学竞赛——问题一直是数学推理的重要目标。2025 年,有研究展示了通过验证与优化流程(该流程在数学领域因单步逻辑可轻松验证正确性而有效)可大幅提升前沿模型在 IMO 题目上的表现并达到金牌水平。 ### 语言推理基准 早期有研究提出了包含语言学奥赛样例的谜题机器。后续工作收集了英国语言学奥赛的翻译与语言推理题目,构建了 LingOly 基准。类似地,Linguini、IOLBENCH 和 LINGOLY-TOO 等基准也基于 IOL 题目构建,涵盖多种低资源语言。既往基准仅关注最终答案的正确性,而 LOBSTER 则为每道题提供了分步解决方案——先用高级 LLM 生成,再由人类专家进行后期编辑。 ### 语言推理的AI进展 高级LLM在语言推理上仍显吃力,相关改进研究却出人意料地稀少。为弥补这一空白,有研究证明多轮逐步交互设置可提升LLM性能,提供类比例证也能增强语言推理表现。另有研究考察了大规模LLM的测试时缩放效应,发现尽管基准性能可提升几个百分点,但仍远低于数学和常识推理基准。 ## 3 IOL中的语言推理 IOL始于2003年,从首届在保加利亚博罗韦茨仅6个国家的36名参赛者,稳步增长至当前在罗马尼亚布加勒斯特举办的第18届比赛,汇聚46个国家的255名参赛者。每个参赛国可派出一至两支4人团队,成员通常通过国家奥赛选拔产生。各国国家奥赛规模和与IOL的相似度各异,题目数量和时长等格式也存在差异。此外还存在其他地区或国际语言学奥赛,如在线语言学奥赛。IOL及其他语言学奥赛的共同目标是:在基础教育阶段普及语言学,提升全球对语言多样性和低资源语言的认知,并促进超越传统学科的问题解决与语言能力培养。 ### 3.1 语言谜题 语言谜题的概念可追溯至早期练习册,并首次被形式化定义,近年该类型谜题的表现形式也持续演进。其核心理念是“自给自足原则”,即题目必须无需任何外语或高级语言学先验知识即可解答。通常选用低资源语言,以最小化解题者熟悉该语言的可能性,从而确保公平性。IOL中的解题者(学生参赛者)会获得关于某种语言的足够信息,包括但不限于若干句子及其翻译、数词系统或文字样本。为解答问题,学生需要从数据中推断相关的语法、音系和词汇模式,并应用这些模式完成任务。默认情况下,参赛者需使用中学课程范围内的概念(如“辅音”“后缀”“动词”等)提供理论解释。参赛者无需且不被期待接受过语言学专业训练——尽管近年培训材料激增,但解决历年奥赛题目仍是备赛IOL的最常见方式。语言谜题常按其体现的语言学子学科分类,如语音学/音系学、形态学、句法、词汇语义学、亲属关系术语、数词系统、计算概念、语料库语言学、文字系统等。也可按问题结构分类,最常见的类型是基于双语语料的翻译或转写任务(“罗塞塔石碑问题”),以及匹配任务(“混沌与秩序问题”)。 ### 3.2 IOL题库 IOL题库包含五道个人赛题目(参赛者需在6小时内独立完成)和一道团队赛题目(需4人团队协作完成)。比赛可使用任何工作语言,题目在所有工作语言中等效。题目由IOL题目委员会在赛前一年设计并多语种呈现。2026年IOL个人赛题目包括:阿拉斯加中尤皮克语的语音与正字法题(P1);耶利德尼语色彩词的词汇语义混沌与秩序题(P2);伊基托语的句法罗塞塔石碑题(P3);萨库拉比亚语的亲属术语混沌与秩序题(P4);以及科姆恩佐语的动词形态罗塞塔石碑题(P5)。 ### 3.3 评分机制 每道题目由IOL评审团部分成员负责评分。在赛前数周题目确定后,每个评分小组会为所负责题目制定评分方案,确定评分标准及权重。评分方案为各项任务及理论部分分配分值。
相似文章
AIMO Interpretability Challenge
AIMO Interpretability Challenge 是一项旨在利用可解释性方法区分前沿数学语言模型中的稳健推理与虚假推理的竞赛,提供新问题、模型访问权限和计算基础设施。
AIPO:通过与主动交互学习推理
本文介绍了 AIPO,一种强化学习框架,通过允许模型在探索过程中主动咨询协作智能体,从而克服能力边界,提升大语言模型的推理能力。
学习如何让大语言模型进行推理
OpenAI 发布了一篇文章,通过密码破译示例探索大语言模型的推理技术,展示了语言模型的逐步问题求解和模式识别能力。
ADAGE:一种语言无关的类比推理评估流水线
ADAGE 是一种语言无关的流水线,用于构建具有挑战性且无需翻译的抽象类比推理基准。它揭示了模型在阿拉伯语、阿姆哈拉语和日语中普遍存在的文化推理差距。
大型语言模型中的交互推理评估:基于可执行游戏的分层基准
本文介绍了一个用于推理评估的多轮交互框架,其中大型语言模型需要查询隐藏环境并整合部分观察结果。该框架实例化为一个包含474个可执行游戏、跨五个难度级别的基准,展示了区分能力并揭示了推理差异。