OenoBench:一个基于知识评估大型语言模型的葡萄酒领域基准
摘要
OenoBench 引入了一个葡萄酒领域基准,用于评估大型语言模型在基于知识的多项选择题上的表现,该基准基于经过验证的来源构建,以解决现有基准的局限性。
arXiv:2608.20106v1 Announce Type: new
摘要:我们引入了 OenoBench,这是一个葡萄酒领域知识基准,包含 3,266 道基于知识的多项选择题,涵盖六个支柱(地区、葡萄品种、葡萄栽培、酿酒、生产商、商业)和四个难度等级。该语料库基于 38,104 条原子、有来源依据的事实构建,这些事实由 35 个经过溯源验证的爬虫从政府注册机构(INAO、TTB、OIV)、同行评审期刊以及 Wikipedia/Wikidata 中提取。我们的方法论贡献是一个大语言模型驱动的流水线,其中语言模型重格式化经过验证的事实并审计结果,但绝不作为真实来源:每条主张都可追溯到一个 URL,每个问题由五种策略中的一种在五个生成器家族中生成,每个问题由九个代理审计评分,该审计通过 Cohen's $\\kappa$ 与人类黄金标准表进行校准。评估十六个前沿配置后,我们发现:(i) 总体准确率在 53% 到 84% 之间,其中 o3 以 83.6% 领先;(ii) 推理模式提升集中在 DeepSeek R1(+6.8 个百分点),在 Claude Opus 和 Gemini Pro 中缺失;(iii) Anthropic 在其自身问题上显示 +9 个百分点的自身偏好,而 Google 显示 -8 个百分点的反向偏好;(iv) 前沿开源模型与专有推理模型共享成本与准确率的帕累托前沿;以及 (v) 每个配置在闭卷可解项目上获得约 33 个百分点的提升,揭示了仅上下文片段能避免的参数回忆上限。我们在 CC-BY-SA-4.0 许可下发布语料库、审计发现、人类审查应用和构建代码。
查看缓存全文
缓存时间: 2026/08/21 10:17
# 一个用于知识基础的大语言模型评估的葡萄酒领域基准测试 来源:https://arxiv.org/html/2608.20106 ###### 摘要 我们推出了**OenoBench**,一个包含 **3,266 道选择题**的葡萄酒领域知识基准测试,涵盖六大支柱(产区、葡萄品种、葡萄栽培、酿酒工艺、生产商、商业)和四个难度等级。该语料库基于 **38,104 条原子化、来源可溯的事实**构建,由 35 个来源验证的爬虫程序从政府机构登记库(INAO、TTB、OIV)、同行评审期刊以及维基百科/Wikidata 中提取。我们的方法论贡献在于一个**LLM驱动的流水线**,其中语言模型仅负责重构已验证的事实并审核结果,但绝不作为真实来源:每项陈述都可追溯到一个URL,每个问题通过五个策略族中的五种策略生成,并通过九个智能体组成的审核系统进行评分,该系统依据人类黄金标准表通过科恩κ系数校准。评估十六种前沿模型配置后,我们发现:(i) 整体准确率范围为53%–84%,以 **o3** 的 83.6% 领先;(ii) 推理模式的提升集中在 **DeepSeek R1**(+6.8个百分点),而 Claude Opus 和 Gemini Pro 则未见提升;(iii) Anthropic 在其自身生成的问题上表现出 **+9 个百分点的自我偏好**,而 Google 则表现出 **-8 个百分点的反向偏好**;(iv) 前沿开源权重模型与专有推理模型在成本-准确性帕累托前沿上共享相似位置;(v) 每种配置在可闭卷求解的问题上均获得约 **33 个百分点**的提升,揭示了仅上下文切片能突破的参数化记忆上限。我们将语料库、审核发现、人类审阅应用及构建代码在 CC-BY-SA-4.0 协议下公开发布。 ## 1 引言 大型语言模型越来越多地在知识密集型基准测试中接受评估,但最常用的资源——如 MMLU[6]、GPQA[16]及其后续作品[19, 21, 15]——存在三个弱点:它们在追求跨学科广度的同时牺牲了单一学科的**深度**;它们通常由小团队使用单一生成流水线构建,这暴露了系统性盲点和风格规律,前沿模型可能学会利用这些特点[14, 20];此外,这些问题越来越多地被怀疑通过网络规模的预训练语料库受到污染[17, 13, 3]。随着模型能力不断增强,基准测试的边际价值越来越取决于其**构建方式**。我们认为,围绕人类通过认证、监管或同行评审实践进行**外部验证**的知识体系构建的专业领域基准测试,是广泛知识基准测试的有益补充。此类基准已在医学[9, 10]、法律[5]和金融[8]领域存在。我们将这一研究方向扩展到一个迄今在基准测试社区中鲜受关注的领域——尽管它异常定义明确:**葡萄酒**。 #### 为何选择葡萄酒? 葡萄酒融合了植物生物学、地质学与气候科学、有机化学、食品微生物学、感觉神经学、监管法律和商业经济学。它是极少数其跨国与政府来源发布结构化分类数据(INAO、OIV、TTB、区域联盟)、大学研究团队(UC Davis、Geisenheim、Bordeaux Sciences Agro)产出开放学术文献,并且专业认证机构(WSET 1-4级、侍酒师大师公会、葡萄酒大师学院)定义分级能力阶梯的领域之一。这些特性使得构建一个每个问题都可追溯至可验证来源、同时覆盖从回忆、推理到应用这一完整光谱的基准测试成为可能,从而区分出优秀的品酒师、酿酒师或采购商与仅记忆术语表的人。 #### 贡献 1. 一个**包含 3,266 个问题的葡萄酒基准测试**,涵盖六大支柱和四个难度等级,基于 38,104 条原子化、来源可溯的事实构建(第3节)。 2. 一个**LLM驱动、基于事实的生成流水线**,采用五种策略×五种生成模型,配有按策略分配的配额和明确的闭卷预筛选——LLM负责重构已验证事实,绝不提供原始事实。 3. 一个**九智能体自动化审核系统**(第4节),通过科恩κ系数依据人类黄金标准表校准;该审核移除了 341 个问题,重新标注了 1,259 个问题的难度,并发现一个智能体(闭卷可解性)相对于人类更易高报泄露风险,我们选择保留该智能体并明确说明而非移除。 4. 一项**跨十六种前沿模型配置、具有偏差感知的评估**(第5节),报告整体准确率、推理模式提升、自我偏好得分、成本效率帕累托前沿,以及闭卷与基于来源的对比,以隔离参数化记忆与上下文推理。OenoBench——包括语料库、审核发现、构建代码和人类审阅应用——在 CC-BY-SA-4.0 协议下发布;发布链接、可重复性脚本和按来源的许可表汇总在附录E中。 ## 2 相关工作 #### 广泛知识基准测试 MMLU[6]、BIG-Bench[19]、AGIEval[21]、GPQA[16]、HELM[12] 和 Humanity’s Last Exam[15] 衡量跨多学科的事实广度和推理能力。我们则在单一外部验证的知识领域内最大化深度,并将**构建时的偏差控制**作为首要贡献而非下游的净化步骤。 #### 领域特定基准测试 MedQA[9]、PubMedQA[10]、LegalBench[5] 和 FinanceBench[8] 将评估建立在具有明确真实来源的受监管专业领域。我们采用了它们基于专家大纲/可追溯来源的框架,并增加了多模型生成、多智能体审核和自我偏见报告。据我们所知,OenoBench 是第一个针对葡萄酒的此类基准测试。 #### LLM作为裁判的偏见与自我偏好 日益增多的文献表明,模型倾向于偏爱与其自身风格相似的输出[14, 20, 18],这在由相同模型生成和评分的基准测试中引入了偏差。我们通过将生成任务分配给五个生成器家族以及确定性模板,并将每个模型自我-他人准确率差距作为首要诊断指标(第5.3节)来缓解此问题。 #### 基准测试污染与可解性 预训练数据接触会夸大模型的表观能力[17, 13, 3]。我们通过从原子事实生成问题(一个事实回声智能体会标记任何与来源最长公共子串超过65%的问题),以及运行明确的**闭卷可解性**预筛选和审核(第5.5节)来缓解此问题。同样的审核系统在依据人类黄金标准表校准时,发现LLM裁判对泄露的高报程度达一个数量级——这一发现对LLM作为裁判的范式具有更广泛的意义。 #### NLP中的葡萄酒 葡萄酒此前在NLP中出现于评论文本推荐[2]、分类学习[11]和评判可靠性研究[7]。OenoBench 是首个针对**葡萄栽培、酿酒和葡萄酒产区的结构化事实知识**并面向前沿LLM进行评估的基准测试。 ## 3 数据集构建 OenoBench 通过一个LLM驱动的流水线(图1)构建,分为两个阶段:(1) **事实收集**阶段,从权威来源构建一个原子化、来源可溯的陈述语料库;(2) **问题生成**阶段,使用五种互补策略和五种生成器模型将这些事实转化为基准测试问题。该流水线围绕一个方法论承诺设计:大型语言模型用作**重构者和审核者**,绝不作为真实来源。语料库中的每条事实都可追溯至带有权威等级标签的URL,每个问题都锚定于一条或多条此类事实,每个问题在发布前都经过九智能体自动化审核系统(第4节)的评分。 ### 3.1 领域分类体系 参见图注:图1:端到端 OenoBench 流水线:权威来源 → 35个爬虫 → 原子事实 → 闭卷门槛 → 九智能体审核 → 发布。我们将葡萄酒知识组织为六个**领域支柱**,选择依据是与 WSET 三级和文凭课程大纲保持一致:(i) **葡萄酒产区**(原产地命名、分类、地理、气候、土壤);(ii) **葡萄品种**(植物形态学、亲缘关系、区域分布、感官特征);(iii) **葡萄栽培**(葡萄园实践、整形系统、病虫害、年份影响);(iv) **酿酒工艺**(酿造选择、发酵、陈酿、缺陷);(v) **生产商**(酒庄、酒商、合作社、主要酒厂);以及 (vi) **葡萄酒商业**(市场、监管、分销、经济学)。每个领域都有独立的目标份额,参考了课程大纲权重和来源可用性;实际分布见表1。 ### 3.2 来源分级、许可与非伪造性 每条事实都标注有三个来源等级之一,反映了循证医学实践: - **等级1(官方,19.6%)**:政府登记库和政府间机构(INAO、OIV、TTB、区域联盟、UC Davis AVA数据库)。 - **等级2(权威,76.6%)**:维基百科、Wikidata SPARQL、葡萄酒机构和联盟网站、同行评审期刊(*OENO One*、*Vitis*、*Australian Journal of Grape and Wine Research*)。 - **等级3(可靠,3.8%)**:HuggingFace 和 Kaggle 上的精选开放数据集、二级参考数据库。 #### 许可与非伪造性 每个来源都是公开记录或在允许爬虫和再分发的许可证下发布:等级1的政府数据采用明确的开放数据许可证(INAO Licence Ouverte、OIV、UC Davis AVA、TTB 公共领域),等级2的维基百科/Wikidata 采用 CC-BY-SA / CC0,期刊(*OENO One*、*Vitis*、*AJEV*)为开放获取;完整的按来源许可表见附录E的表16。一个核心设计承诺是**语料库中没有事实来自LLM的内部知识**:每条事实都由特定来源的爬虫程序提取,标注有来源URL、检索时间戳和等级标签后才插入,事实插入工具会拒绝没有可验证来源URL追踪的记录。我们强调这一点,因为LLM生成的内容伪装成爬虫数据是一种污染向量,传统的数据集文档无法检测到。 表1:原子事实语料库:来自35个爬虫、六大领域支柱、三个来源等级的38,104条事实。 ### 3.3 原子事实提取 源页面通过一个五阶段流水线(图5,附录B.1)分解为原子事实:句子分割;指称消解(代词替换为其指代实体);领域分类至六个支柱之一;长度/谓词验证器(5-50个词,必须包含动词,无悬空指称);以及区域关键词主题过滤器,以防止交叉污染(例如,波尔多爬虫中的奥地利内容)。Wikidata SPARQL 查询使用直接国家关系(P17)而非传递性父关系(P131*),后者在早期爬虫中曾导致严重的跨区域泄露(附录B)。事实必须是**原子化**的(每个句子一个断言)、**实体标注**的(主体和客体链接到规范知识图谱ID)以及**来源忠实**的(意译,绝非逐字复制);最后一点在提取时强制执行,并在审核阶段由智能体A3复核。 ### 3.4 问题生成:五种策略,五种模型 单一策略、单一模型的基准测试会继承其流水线的盲点。我们通过结合**五种策略**和**五种生成器模型**来缓解此问题,配额由一个协调器执行,该协调器可在多次运行间安全恢复。策略包括: - **事实转问题(58.4%,1,909个问题)**:LLM将一条已验证的事实重写为选择题;保持基础性但倾向于回忆。 - **干扰项挖掘(12.4%,405个)**:混淆实体采样生成错误答案,这些答案与正确答案共享类别和维度,提高似然性并迫使细粒度区分。 - **模板(11.9%,389个)**:涵盖六大支柱的四十五个确定性参数化模板;纯实体替换,零LLM创造力——作为神经生成测量的基线。 - **情景合成(9.8%,319个)**:连贯的事实簇被转换为应用型多事实推理提示(例如,侍酒师的服务决策、酿酒师的混酿决策、葡萄栽培师的年份判断)。领域特定的情景类型防止了人物-内容不匹配。 - **比较(7.5%,244个)**:实体亲和度评分配对相关实体(例如,两个勃艮第一级园、两个罗纳谷葡萄品种),询问“哪一方在X上不同”或“两者共有何特征”。 五种生成器模型是 Claude Opus 4.7、GPT-5、Gemini 2.5 Pro、Llama 3.1 405B 和 Qwen 3.5 235B,每个都通过统一的 OpenRouter 客户端访问,采用一致的温度和 top-p。已发布语料库中实际生成器分布为:**Qwen 20.4%、Llama 19.3%、Claude 19.0%、ChatGPT 16.6%、Gemini 12.9%、确定性模板 11.9%**(直接从发布的 3,266 个问题计算得出)。协调器根据每轮试点审核通过率动态分配生成份额——问题通过审核可靠的生成器在后续轮次中获得更大份额——但受制于每个生成器 **21%** 的硬性上限,以防止单一模型主导语料库。 ### 3.5 最终语料库:release_v1.2 经过生成、审核和后评估审查后,发布的语料库 release_v1.2 包含 **3,266 个问题**。沿领域和难度轴的分布如下: 表2:已发布语料库的构成。release_v1.2 在 HuggingFace 上以 CC-BY-SA-4.0 协议发布,附带 Croissant 清单和附录A中的完整数据表。
相似文章
FINESSE-Bench:面向大语言模型金融领域知识与技术分析的分层基准测试套件
本文介绍了FINESSE-Bench,一个包含八个专业基准、共3,993个问题的套件,用于对大语言模型进行金融能力的分层评估,涵盖专业认证主题与应用交易任务。
JOR-Bench:面向大型语言模型的日语运筹学基准测试
JOR-Bench 是一个包含五个日语基准测试的集合,用于评估大型语言模型在运筹学问题建模方面的能力,这些基准测试从现有的英语基准翻译而来。评估结果显示整体性能与语言无关,仅有轻微的跨语言差异。
BAGEL:语言模型中的动物知识专业性基准评估
BAGEL是一个用于评估大语言模型中与动物相关知识的新基准,从多种科学资源构建,涵盖分类学、形态学、栖息地、行为和物种相互作用等方面,通过闭卷问答对形式呈现。该基准可以进行跨分类群和知识类别的细粒度分析,为生物多样性应用中的模型优势和失败模式提供洞见。
Pre-Flight: 评估大型语言模型航空运行知识的基准测试
本文介绍了Pre-Flight,这是一个包含300道多选题的开源基准测试,旨在评估大型语言模型在航空运行知识方面的表现,覆盖国际法规和地面操作。结果显示,即使是2026年最强模型也只能达到82.7%的准确率,远低于约95%的专家参考水平,突显了持续存在的可靠性差距。
Know2Guess:一种面向大型语言模型知识边界评估的污染感知多区域基准
本文介绍了Know2Guess,一种污染感知的多区域基准,旨在评估大型语言模型从可回答知识到预期拒答的转换,解决数据污染、提示敏感性和拒绝行为问题。作者评估了FLAN-T5、Qwen2.5-Instruct和Llama-3-Instruct模型,发现更强的模型表现出选择性但不完全的拒答。该基准和数据集已公开发布。