Pitwall:来自校准实时蒙特卡洛引擎的忠实自然语言比赛策略简报

arXiv cs.CL 论文

摘要

Pitwall 是一个生产系统,通过将声明分解为类型化的事实断言,并针对校准的蒙特卡洛比赛模拟器逐一验证每个断言,从而生成忠实的自然语言一级方程式策略简报,确保无幻觉输出。

arXiv:2607.06495v1 公告类型:新 摘要:现场体育解说是在截止时间下进行的实时生成:评论涉及真实、具名的运动员,状态每几秒变化一次,且生成时不存在参考文本。我们介绍 Pitwall,一个生产系统,能够以英语、西班牙语和葡萄牙语生成自然语言的一级方程式策略简报,将忠实度视为架构特性而非期望:每个已发布的句子被分解为类型化的事实断言(位置、差距、轮胎、配速、超车、比赛控制),每个断言均针对触发它的概率比赛状态进行验证。同样的验证器也用于筛选微调数据:在 3,045 个模型编写的目标中,仅保留所有断言均被状态支持的 81.9%,其余则退回到可证明忠实的模板,因此生成器从未见过无根据的目标。验证之所以有意义,是因为有基于事实的支撑:一个向量化的蒙特卡洛引擎(每圈 N=2,000 次比赛延续),基于 126 场比赛(2018-2024)进行校准,并在完全留出的 2025-2026 赛季上验证(155 次回测中前三名包含胜者的准确率为 90.3%;留出集的 Brier 得分为 0.0745)。一个反复出现的发现贯穿系统两半:优点之间存在权衡,必须分别控制。在模拟中,校准最优不等于决策最优;在生成中,对更丰富目标进行微调可获得生动性,但当支撑状态稀疏时,这种生动性会崩溃为幻觉——一个四次复现将失败根源追溯到基础模型的指令遵循能力,而非规模,而稀疏上下文审计则从生产模型中消除了这种失败。端到端运行——从实时计时到经过验证的三语简报——已在连续两场现场大奖赛(2026 年奥地利站和英国站)中得到确认;在银石赛道,一个在结果已知之前就提交到磁盘的带时间戳概率追踪,在比赛结束前十圈就锁定到了最终胜者。
查看原文
查看缓存全文

缓存时间: 2026/07/08 04:42

# 基于校准实时蒙特卡洛引擎的忠实自然语言比赛策略简报

来源:https://arxiv.org/html/2607.06495

###### 摘要

直播体育评论是在截止时间压力下进行的实时生成:评论涉及真实、具名的运动员,基本状态每几秒变化一次,且生成时不存在参考文本。本文介绍 **Pitwall**,一个面向生产环境的系统,能够生成英语、西班牙语和葡萄牙语的自然语言一级方程式比赛策略简报,并将忠实性视为**架构性**属性而非目标追求:每个输出的句子都被分解为类型化的事实主张(位置、差距、轮胎、节奏、超车、赛事控制),每条主张均根据触发其生成的概率化比赛状态进行验证。同样的验证器也在微调数据阶段把关——在 3,045 个人工编写目标中,仅保留 81.9% 其每条主张均受状态支持的目标;其余目标则回退到可证明忠实的模板——因此生成器在训练过程中从未见过不支持的目标。使验证具有**意义**的是底层基础:一个向量化蒙特卡洛引擎(每圈推进 \(N=2,000\) 场比赛延续),其概率已在 126 场比赛(2018–2024)上完成校准,并在完全未见的 2025–2026 赛季上得到验证(155 次回溯测试中冠军在前 3 命中率 90.3%;未见过赛季 Brier 分数 0.0745)。一个反复出现的发现贯穿系统两部分:不同优点之间存在权衡,必须分别加以控制。在仿真中,校准最优并不等于决策最优;在生成中,对更丰富目标进行微调可提升信息密集状态下的生动性,但恰恰在基础状态稀疏时坍缩为幻觉——通过四个基础模型的重复实验表明,这种失败源于基础模型的指令遵循能力而非规模,而在稀疏上下文审计下选择基础模型可在生产环境中消除此问题。端到端运行——从实时计时到经过验证的三语简报——已在连续两场实时大奖赛(2026 年奥地利和英国)中得到确认;在银石赛道,一个时间戳概率轨迹(在结果公布前已写入磁盘)在冲线前十圈便锁定了最终冠军。

## 1 引言

现代一级方程式比赛的胜负往往在维修区墙上与赛道上同等程度上决定。一次进站大约消耗 20–25 秒比赛时间,轮胎配方以非线性且赛道特定的速率退化,超车难度在不同场地间相差一个数量级,安全车干预随机出现并在单圈内重新评估所有开放式策略选项。因此,车队策略师必须持续两小时、每隔不到一分钟回答如下形式的问题:**如果我们现在进站,超车车辆的概率是多少——如果再多等两圈,结果又会如何变化?** 每支顶级车队都为此目的运行仿真工具,但这些工具是专有的,其校准从未经过公开审计,而关于比赛策略仿真的学术文献(Bekker and Lotz,2009 (https://arxiv.org/html/2607.06495#bib.bib1); Heilmeier et al.,2020a (https://arxiv.org/html/2607.06495#bib.bib9))尚未涵盖实际问题求解所需的实时、概率校准、以决策为核心的场景。此外,这些答案是以**语言**形式被消费的。工程师、转播方和观众阅读的不是概率向量,而是句子——“诺里斯进站并以 P4 重返赛道,落后赛恩斯 2.1 秒,使用中性胎”——而一个关于真实、具名运动员的生成句子,若信心十足却错误至极,则比没有句子更糟。因此,直播评论是基础生成的一个高要求实例(Wiseman et al.,2017 (https://arxiv.org/html/2607.06495#bib.bib20); Ji et al.,2023 (https://arxiv.org/html/2607.06495#bib.bib11)):基础状态每几秒变化一次,生成时不存在参考文本(完全排除基于参考的评估),而稀疏时刻(比赛初期、数据摄入中断后的部分状态)恰恰是流畅生成器最倾向于从其先验知识中填充的内容。

本文介绍 **Pitwall**,据我们所知,这是第一个公开记录的端到端系统,它能够:(i) 在比赛期间摄取官方 F1 实时计时流;(ii) 维护一个规范的概率化比赛状态;(iii) 通过向量化蒙特卡洛仿真以交互延迟评估策略反事实;(iv) 报告**校准后的**概率——获胜、领奖台、积分以及进站超车成功概率——并在七个完整计分赛季的历史比赛(2018–2025,不含 2022 年)及 2026 年前几场比赛上得到验证;(v) 以英语、西班牙语和葡萄牙语将状态和建议表述为自然语言简报,仅发布那些事实主张通过了引擎状态验证的文本(第 6 节 (https://arxiv.org/html/2607.06495#S6))。该系统在商品化云基础设施上运行;其运行可行性已在 2026 年奥地利和英国大奖赛的实时环境中得到确认。除系统本身外,我们提出一个我们认为可推广至其他体育项目决策支持系统的方法论论证。仿真组件通常因其使仿真器更**逼真**而被采用。但我们却用两个独立的未见过测试加以把关:该组件是否改善**结果校准**(Brier 分数和最终名次概率的可靠性),以及是否改善**决策保真度**(推荐策略是否与实际情况匹配)。在我们的实验中,这两个标准反复出现分歧。一个学习的超车核——在预测单次超越时优于阈值基线(Brier 0.0275 对 0.0298,每场超车数 MAE 8.9)——一旦接入仿真器并围绕其重新校准,并不能改善场级校准;而一个可证明能修复病态实时进站判断的复合节奏归一化方法,却**恶化**了最终名次预测,因为原始混杂的每场比赛拟合携带了真实的比赛特定信号。该引擎并未通过强制执行来解决这一矛盾,而是将每个组件路由至其所优化的路径:产生校准概率的**预言机路径**保留 Brier 最优配置,而产生建议的**决策路径**则使用可行性感知的归一化模型。语言层提供了同一个教训的第三个实例:对评论生成器进行更丰富、更自然的目标微调可提升信息密集状态下的流畅性和覆盖率,但相同的模型在基础状态稀疏时会捏造车手、差距和轮胎配方(第 7.7 节 (https://arxiv.org/html/2607.06495#S7.SS7));将该方案在四个基础模型上重复实验表明,这种失败是基础模型指令遵循能力的属性,而非规模或训练数据的问题——丰富性和精确性,如同校准性和决策质量一样,是必须分别控制的不同目标,而基础模型本身即是控制门之一。我们同时报告正面和负面的门控结果,因为负面结果——在应用体育分析中罕见——恰恰使忠实性和校准性声称变得可信。

我们的贡献如下:

1.  **一个经过验证和校准的实时蒙特卡洛引擎。** 一个向量化仿真器(所有 \(N\) 场比赛同时以 \(N \times C\) 数组操作(\(C\) 为赛车数)推进),包含每圈的安全车和虚拟安全车模式、脏空气交互、随机退赛以及博弈论对手策略;通过边界约束差分进化在 126 场训练比赛(2018–2024)上校准,并使用 Brier 分数、期望校准误差和可靠性分析在完全未见的 2025–2026 赛季上评估(第 5 节 (https://arxiv.org/html/2607.06495#S5)、第 7 节 (https://arxiv.org/html/2607.06495#S7))。
2.  **一个学习的超车核及其诚实的消融实验。** 一个超越概率的逻辑模型,在 131,000 场相邻赛车对决(4,142 次干净超越)上拟合,包含每条赛道的难度偏移;该模型在样本外改善了超越预测(Brier 0.0275 对比基线 0.0298,每场超越数 MAE 8.9),但接入仿真器后却未带来场级校准增益——这是一个具有启发意义的负面结果,我们在第 4.3 节 (https://arxiv.org/html/2607.06495#S4.SS3) 中进行了分析。
3.  **作为 CRN 反事实的进站窗口。** 将“现在进站”/“晚些进站”决策形式化为一个公共随机数比较,涵盖进站视界 \(h \in \{0,1,2\}\) 及不进站策略,使得不同选项之间的概率差异反映策略而非采样噪声,并为每个报告的概率提供百分位自助法置信区间(第 4.7 节 (https://arxiv.org/html/2607.06495#S4.SS7))。
4.  **复合基准归一化以及校准/决策分离。** 一个原则性方法,将拟合的每种配方基准节奏投影到规范的软胎 \(\leq\) 中性胎 \(\leq\) 硬胎顺序上,消除了导致病态“进站换快胎”实时判断的配方 \(\times\) 比赛阶段混杂效应;同时发现该修正必须仅存在于决策路径上(第 4.4 节 (https://arxiv.org/html/2607.06495#S4.SS4)、第 5.3 节 (https://arxiv.org/html/2607.06495#S5.SS3))。
5.  **一个验证器门控的语言层,以及忠实性门控的微调。** 一个类型化主张方案(十个主张类型,涵盖位置、差距、轮胎、节奏、超车和赛事控制),具备三种语言的提取和状态验证功能;一个包含 3,045 个三语简报目标的微调语料库,其中一个人工编写目标仅在其每条主张均受比赛状态支持时才被采纳(81.9% 被采纳;其余回退到可证明忠实的模板);以及在四个基础模型(1B–7B)上的未见过审计显示,由此产生的丰富性–精确性权衡是真实存在的但依赖于基础模型:三个基础模型在稀疏状态下精确地产生幻觉,而第四个则选择规避,从而将基础模型的指令遵循能力——而非参数量或训练数据——确定为决定性因素(第 6 节 (https://arxiv.org/html/2607.06495#S6)、第 7.7 节 (https://arxiv.org/html/2607.06495#S7.SS7))。
6.  **一个端到端的实时部署。** 实时计时摄入 \(\rightarrow\) 状态重建 \(\rightarrow\) 校准蒙特卡洛 \(\rightarrow\) 建议 \(\rightarrow\) 验证器基础的自然语言评论,在 2026 年奥地利和英国大奖赛上演示,后者还包含一个实时概率轨迹,已对照官方结果评分(第 7.5 节 (https://arxiv.org/html/2607.06495#S7.SS5)–第 7.6 节 (https://arxiv.org/html/2607.06495#S7.SS6))。

## 2 相关工作

#### 比赛策略仿真。

早期工作将场地赛策略建模为确定性圈时优化:Bekker and Lotz (2009 (https://arxiv.org/html/2607.06495#bib.bib1)) 构建了赞德福特赛道的离散事件仿真用于比赛规划,Limebeer et al. (2014 (https://arxiv.org/html/2607.06495#bib.bib16)) 将燃油/轮胎调度视为最优控制问题。学术上最完整的处理是 Heilmeier et al. (2020a (https://arxiv.org/html/2607.06495#bib.bib9)) 的比赛仿真,其 FAST 算法结合了圈时、轮胎退化和燃油模型,后来通过基于神经网络的虚拟策略工程师得到扩展(Heilmeier et al.,2020b (https://arxiv.org/html/2607.06495#bib.bib10))。这些仿真器被校准以重现比赛**时间**;没有一款报告比赛**结果**的概率校准,没有一款在公共随机数下建模“现在进站 vs 晚些进站”的反事实,也没有一款针对实时计时数据流运行。蒙特卡洛比赛仿真也在商业上使用(例如车队自身和转播提供商),但没有公开的方法论或验证。

#### 体育领域的蒙特卡洛方法与预测。

蒙特卡洛赛季和比赛仿真器在篮球、橄榄球和足球分析中是标准工具;预测质量通常使用 Brier 分数(Brier,1950 (https://arxiv.org/html/2607.06495#bib.bib2))及其可靠性–分辨率–不确定性分解(Murphy,1973 (https://arxiv.org/html/2607.06495#bib.bib15))进行评估。我们对模拟事件概率使用百分位自助法置信区间,遵循标准的重采样实践(Efron and Tibshirani,1994 (https://arxiv.org/html/2607.06495#bib.bib4));而我们用于在共享随机世界下比较策略的方差缩减策略是随机仿真文献中经典的公共随机数技术(Glasserman and Yao,1992 (https://arxiv.org/html/2607.06495#bib.bib5); Law,2015 (https://arxiv.org/html/2607.06495#bib.bib13))。更广泛的概率分类器和预测器的校准由 Guo et al. (2017 (https://arxiv.org/html/2607.06495#bib.bib7)) 和 Gneiting et al. (2007 (https://arxiv.org/html/2607.06495#bib.bib6)) 综述;我们采用了该文献中的可靠性图和期望校准误差 (ECE)。

#### 一级方程式中的超车与交互效应。

一级方程式中的超车强烈依赖于赛道和节奏。历史超车数据的统计分析(de Groote,2021 (https://arxiv.org/html/2607.06495#bib.bib17))记录了街道赛道和动力赛道之间超车次数的数量级差异,这与我们的核所学习的每条赛道偏移一致(摩纳哥和伊莫拉最难;拉斯维加斯、斯帕和卡塔尔最易)。跟车时的空气动力学尾流(“脏空气”)惩罚在车辆动力学文献中有记载,并推动了 2022 年技术规则(Guerrero and Castilla,2020 (https://arxiv.org/html/2607.06495#bib.bib3));我们将其建模为在差距窗口内的每圈校准损失,而非空气动力学模型。轮胎退化建模(包括非线性的“悬崖”)出现在比赛轮胎的工程处理中(Kelly and Sharp,2012 (https://arxiv.org/html/2607.06495#bib.bib12); Heilmeier et al.,2020a (https://arxiv.org/html/2607.06495#bib.bib9));我们的贡献是从七个计分赛季的胎段数据中通过显式证据门挖掘赛道和配方特定的悬崖节点,而非全局假设一个函数形式。

#### 数据基础生成中的忠实性。

数据到文本生成长期以来通过将输出分解为与源记录核对的原子的检查来进行评估,从 Wiseman et al. (2017 (https://arxiv.org/html/2607.06495#bib.bib20)) 关于篮球技术统计的抽取式指标到黄金标准事实级协议(Thomson and Reiter,2020 (https://arxiv.org/html/2607.06495#bib.bib19));在抽象摘要中,Maynez et al. (2020 (https://arxiv.org/html/2607.06495#bib.bib14)) 确立了流畅的神经生成器会制造输入不支持的内容的幻觉,Ji et al. (2023 (https://arxiv.org/html/2607.06495#bib.bib11)) 综述了由此产生的幻觉文献。我们的场景以三种方式加剧了这些关切:所声称事实涉及实时、具名的运动员;基础源是一个圈间变化的概率状态,因此验证必须**无参考**;生成在延迟预算下进行,排除了事后人工审查。我们在此基础上建立的主张提取与验证方法论,包括低覆盖率抽取器使忠实性分数退化的发现,在配套论文中发展(Santillana,2026 (https://arxiv.org/html/2607.06495#bib.bib18));这里我们将其从赛后真值扩展到实时状态,并且——据我们所知——首次将验证器不仅用于评估,还用作**微调数据本身的准入门**(第 6.2 节 (https://arxiv.org/html/2607.06495#S6.SS2))。

#### 决策支持与人在回路部署。

我们的部署理念——将校准概率与不确定性区间一并呈现给人类决策制。

相似文章

HalluWorld:基于参考世界模型的可控幻觉基准

arXiv cs.CL

HalluWorld 是一个可控基准框架,通过显式的参考世界模型在网格世界、国际象棋和实际终端任务等合成环境中评估大型语言模型中的幻觉。它可以细粒度分析各种故障模式,例如感知幻觉、多步状态追踪和因果模拟,揭示出前沿模型在处理扩展思维无法解决的复杂推理时仍然存在困难。

HalBench:我构建了一个自定义的谄媚与幻觉基准测试,并评估了4个前沿模型(Sonnet 4.6、Grok 4.3、GPT 5.4 和 Gemini 3.1 Pro),希望得到关于接下来应运行哪些开源模型的建议!

Reddit r/LocalLLaMA

HalBench 是一个新的开放基准测试,用于衡量大语言模型中的谄媚与幻觉现象,通过 3,200 个基于错误前提的提示对四个前沿模型进行了测试。结果显示,Sonnet 4.6 和 Grok 4.3 在诚实反驳方面优于 GPT-5.4 和 Gemini 3.1 Pro。