Jev 思考 "我不知道",但未言明:介绍用于概率校准的 Sys1Cal-v1 数据集
摘要
介绍了 Sys1Cal-v1 数据集,用于评估 AI 模型的概率校准,表明像 Jev 这样的模型可能在二进制输出中抑制不确定性。
查看缓存全文
缓存时间: 2026/09/30 08:19
论文页面 - Jev 认为“我不确定”,但未明说:介绍用于概率校准的 Sys1Cal-v1 数据集
来源:https://huggingface.co/papers/2609.35342
Sys1Cal-v1 提出了一个简单的问题:当系统一模型返回一个概率时,该概率是否真的具有我们所假设的数值含义?我们引入了一个基准测试,其中每个命题的精确概率在构建时已知,使我们能够直接评估结构化概率输出,而不仅仅是检查预测类别的置信度。
将 Sys1Cal-v1 应用于 Jev 揭示了其基本元素之间的明显不对称性:Noul 和 Score 仍然显著接近真实概率,而二元 Choice 输出则表现出系统性的非线性失真。我们表明,这种失真可以通过引入一个潜在的第三个成分——不确定——与真和假并列来建模。在此模型下,Choice 的行为仿佛移除了不确定质量,并对剩余的真/假概率进行了重新归一化。
这不仅关乎校准。一旦不确定性被显式表示,相同的模型输出可以支持不同的下游行动:二元分布可能为确定某种结果提供依据,而对应的潜在表征则可以在错误代价高昂时为推迟决策提供依据。
我想探讨的更广泛问题是:这一现象是否仅限于 Jev,还是将更丰富的概率表示强制转换为二元或分类输出系统性地抑制了其他模型中与决策相关的不确定性?Sys1Cal-v1 和评估代码均已公开,非常欢迎在其他结构化决策模型上进行复现。
相似文章
TypeSafe的Jev无法生成无效输出,但其校准声明未附带ECE或可靠性曲线
TypeSafe AI推出了其Jev模型,声称没有幻觉且概率经过校准,但文章质疑校准缺乏公开证据,同时指出开发者快速采用。
Jev
Jev 是 TypeSafe AI 的前沿模型,用于快速、结构化的AI决策,返回带有校准概率的类型化输出,现已向所有人开放。
一款估值四千万美元的模型正以"校准置信度"作为卖点,然而至今未见任何校准数据公开发布。
TypeSafe AI推出了Jev模型,宣称其AI回答具有标定置信度,但因未公开标定数据引发质疑,尽管其早期采用指标表现强劲。
Chinese-Jev:将系统一模型应用于中文任务
本文介绍了Chinese-Jev,一个旨在提高中文任务决策准确性和效率的系统一模型,通过领域特定的微调和一个新的基准测试CJ-Bench进行评估。
超越Jev:更快、更准、多模态能力提升 [P]
Intern-Decision 多模态模型家族(0.8B、2B、4B)已发布,其中4B模型在决策任务中超越Jev 1.13.0,支持快速本地部署,并在概率问题上改进了校准。