Jev 思考 "我不知道",但未言明:介绍用于概率校准的 Sys1Cal-v1 数据集

Hugging Face Daily Papers 论文

摘要

介绍了 Sys1Cal-v1 数据集,用于评估 AI 模型的概率校准,表明像 Jev 这样的模型可能在二进制输出中抑制不确定性。

Jev 的出现标志着系统一模型时代的到来,这些基础模型返回的是带有概率分布的结构化决策,而非文本。除了低成本和高速度,Jev 的核心承诺是这些概率是校准过的:但这一说法没有得到任何公开测试的支持,现有的外部基准评估的是置信度校准,而非每个返回选项概率是否具有正确的数值意义。为解决此问题,我们推出了 Sys1Cal-v1 数据集,这是一个关于命题 A 的真/假问题集,其中精确概率 P(A) 是通过构造已知的。每个项目通过 Jev 的三个原语——Noul、Choice 和 Score 进行查询,并通过与真实分布的全变差距离进行评估,这可用于估计系统一模型的软准确率。 我们通过评估 Jev 和 SemIf(一个开源的 Choice 风格基准)来展示 Sys1Cal-v1 作为基准数据集的效用。然而,在本研究中,我们更深入地聚焦于 Jev,研究其 Score 和 Choice 回答的校准性。特别是,我们发现了一种奇特的行为,这可以通过假设 Jev 抑制了第三种真值来解释,超越了真与假。换句话说,在 Choice 回答中,P(A) 和 P(neg A) 被呈现为 P(A)+P(neg A)=1,而总和中缺少了 P(U)≠0 这一项。恢复 P(U) 使得 Choice 回答的中值软准确率从 0.771 提升到 0.978,这表明即使在二元决策中,Jev 也想用第三个选项来回答:``我不知道''。
查看原文
查看缓存全文

缓存时间: 2026/09/30 08:19

论文页面 - Jev 认为“我不确定”,但未明说:介绍用于概率校准的 Sys1Cal-v1 数据集

来源:https://huggingface.co/papers/2609.35342

Sys1Cal-v1 提出了一个简单的问题:当系统一模型返回一个概率时,该概率是否真的具有我们所假设的数值含义?我们引入了一个基准测试,其中每个命题的精确概率在构建时已知,使我们能够直接评估结构化概率输出,而不仅仅是检查预测类别的置信度。

将 Sys1Cal-v1 应用于 Jev 揭示了其基本元素之间的明显不对称性:Noul 和 Score 仍然显著接近真实概率,而二元 Choice 输出则表现出系统性的非线性失真。我们表明,这种失真可以通过引入一个潜在的第三个成分——不确定——与真和假并列来建模。在此模型下,Choice 的行为仿佛移除了不确定质量,并对剩余的真/假概率进行了重新归一化。

这不仅关乎校准。一旦不确定性被显式表示,相同的模型输出可以支持不同的下游行动:二元分布可能为确定某种结果提供依据,而对应的潜在表征则可以在错误代价高昂时为推迟决策提供依据。

我想探讨的更广泛问题是:这一现象是否仅限于 Jev,还是将更丰富的概率表示强制转换为二元或分类输出系统性地抑制了其他模型中与决策相关的不确定性?Sys1Cal-v1 和评估代码均已公开,非常欢迎在其他结构化决策模型上进行复现。

相似文章

Jev

Product Hunt

Jev 是 TypeSafe AI 的前沿模型,用于快速、结构化的AI决策,返回带有校准概率的类型化输出,现已向所有人开放。