@flitternie: Jev 通过将决策视为首要模型问题而引起了许多关注。我写了关于它失败的地方……

X AI KOLs Timeline 模型

摘要

Jev 通过使用预定义输出空间而非生成来重新定义AI决策,为企业及长期任务提供效率提升,如详细讨论中所分析。

Jev 通过将决策视为首要模型问题而引起了许多关注。 我写了关于它失败的地方、其概率实际意味着什么,以及为什么它可能对企业和长期代理在开放任务中很重要。 https://t.co/Ek4cv6lCt0 https://t.co/WjPsoiWKcG
查看原文
查看缓存全文

缓存时间: 2026/09/26 17:05

Jev 将决策作为一等模型问题来处理,吸引了众多关注。我此前曾探讨过它的局限性、其概率的实际含义,以及它为何对企业和执行开放任务的长期智能体具有重要性。
https://t.co/Ek4cv6lCt0
https://t.co/WjPsoiWKcG


通过 Jev 重新思考 AI 决策

来源:https://lynie.cc/blogs/jev/

通过 Jev 重新思考 AI 决策

过去几年,大语言模型几乎将所有 AI 任务都转变成了生成问题。需要分类器?生成一个标签。需要排序?生成一个有序列表。需要二选一决策?生成一个字符串,再解析出答案。Jev 采取了不同的路径——它从接口中移除了生成过程。TypeSafe 将 Jev 称为 系统一模型 (https://typesafe.ai/blog/introducing-system-one-models-and-jev)。其输入仍可以是自然语言或其他非结构化信息,但输出空间是预先定义的。Jev 从预定义选项中进行选择,并返回每个选项的概率。TypeSafe 将其定位为软件的决策模型,而非更快的聊天机器人。

这种设计让人回想起 BERT 和早期 GPT 模型之间分工明确的时期。编码器模型广泛用于分类和排序。GPT 从 next-token 预测开始,最终将生成转变为一个极其通用的接口。与 BERT 的相似之处在于分工,而非架构。随着 LLM 能力的增强,生成接管了许多我们曾为之训练分类器的任务。其好处在于通用性:应用不再需要为每个任务准备新的标注数据集和新的模型。代价是,即使是简单的决策也继承了生成模型的延迟和成本。Jev 让这一权衡再次显现:如果选项已知,我们是否仍需昂贵的 LLM?

当答案空间已知时,什么会发生变化?

标准的自回归语言模型将输出序列的概率表示为:

P(y₁:T|x) = ∏ₜ₌₁ᵀ P(yₜ|x, y<ₜ)

当输出空间是有限的选项集时,这个乘积可以简化为对每个候选的单次评估。模型不需要按顺序生成令牌;它只需要返回每个选项的概率。

考虑以下逻辑谜题:

爱丽丝和鲍勃各自要么是诚实者(总是说真话),要么是骗子(总是说谎话)。
爱丽丝说:“鲍勃是骗子。”
鲍勃说:“我们不是同一类人。”
哪种分配是正确的?
A. 爱丽丝是诚实者;鲍勃是骗子
B. 爱丽丝是骗子;鲍勃是诚实者
C. 两人都是诚实者
D. 两人都是骗子

正确答案是 B。如果爱丽丝说真话,那么鲍勃是骗子——但那样鲍勃声称他们不是同一类人的话也成了真话,矛盾。唯一没有矛盾的分配是爱丽丝说谎,鲍勃诚实。

Jev 选择了 A,并赋予其 0.69 的概率。正确答案只得到 0.15。

Jev 对四种可能分配的概率分布
图 3 — Jev 选择了错误的分配。正确答案仅获得 15%。

同样的局限性在基准测试规模上显现。Jev Decision Index (https://huggingface.co/spaces/multimodalart/jev-decision-index) 在 Humanity’s Last Exam 的多选题部分报告了 20.1% 的准确率,而随机选择基线为 16.4%。这大约是 OpenAI 在 2025 年中期报告的 o3 在 HLE 上的得分 (https://openai.com/index/introducing-o3-and-o4-mini/):20.32%。四个选项并未使谜题变容易,多选题也未使 HLE 变容易。

即使达成决策需要大量推理,其输出空间也可能很小。
考虑这个问题:

我们应该给这位客户退款吗?

它可能是一个基于单条消息的本地意图分类问题。也可能需要查看过去三个订单、检查退款政策中的几项例外情况,并推导出当前请求是否符合条件。两种调用都返回 yes 或 no,但其计算需求完全不同。仅凭任务类型无法告诉我们如何划分系统一和系统二。即使是同一任务的两个输入也可能需要截然不同的推理量。

与其问 Jev 是否比 LLM “更好”,不如问:工作流是否可以分解为独立的、定义良好的局部判断?如果可以,快速决策模型就很合适。TypeSafe 的示例 (https://typesafe.ai/blog/introducing-system-one-models-and-jev) 大多具有这种形式:确定性的业务逻辑保留在代码中,而模型则回答那些难以用规则表达的局部语义问题。

从单一模型到计算层次结构

如果 Jev 不为复杂推理而生,为何不训练分类器?当一个组织处理数百万类似请求、类别稳定且可靠标签充足时,小型专用模型难以被击败。它更便宜,并且可以针对固定任务进行优化。许多应用根本不需要基础模型。

更难的问题是冷启动,以及随之而来、不断变化的长尾问题。新工作流可能有一个定义良好的动作空间,却没有成千上万的标注样本。Jev 的零样本或少样本泛化能力在此时很有价值。随着系统运行,输入分布中那些反复出现且被充分理解的区域,可以逐渐转移到更小的模型进行直接处理。这些模型无需竞争同一任务。它们可以组成一个持续学习的系统。

应用程序自己的分类器首先处理熟悉输入。只有异常值到达 Jev,而其中需要证据组合或逐步推理的那一小部分子集,则继续交由推理型 LLM 处理。这种观点与我们早前关于在线级联学习 (https://proceedings.mlr.press/v235/nie24a.html) 的工作密切相关。我们研究了针对流数据的模型级联:小模型处理它确信的输入,而困难的输入则推迟给 LLM。关键在于反馈。LLM 的输出成为小模型在线更新的标注,使其随着数据流的继续能够直接处理更多输入。在四个基准测试中,该方法将推理成本降低了高达 90%,同时达到甚至超过了 LLM 的准确率。

Jev 在此重要,并非因为它增加了一层,而是因为它增加了另一个标注来源。Jev 和推理型 LLM 都可以对异常值进行标注,并将这些标签返回给应用程序的分类器。随着这些标注的积累,分类器会吸收长尾中反复出现的部分。今天由 Jev 处理的异常值,明天可能直接由分类器处理。Jev 和推理型 LLM 则专注于处理分类器尚未学会的模式。

一个自适应的模型级联
图 4 — 一个自我演进的模型级联。应用程序的分类器处理大多数输入;Jev 和推理型 LLM 处理异常值并返回新的标注。持续更新使分类器能直接处理更多输入。

这个循环仍然依赖于决定哪些 Jev 标签可以安全回流,哪些情况应继续交给推理型 LLM。返回的概率可能有所帮助,但前提是我们理解其含义。

概率意味着什么?

首要问题是 Jev 概概率究竟描述什么。在一个测试中,我问:

从 1 到 5 中随机抽取一个整数,概率均匀分布。

我提供了整数 1 到 5 作为候选。如果将该句子视为程序规范,所请求的分布是:

P(Y=i) = 0.2, i=1,…,5.

Jev 返回了不同的分布:
(P(1), P(2), P(3), P(4), P(5)) = (0.24, 0.13, 0.50, 0.06, 0.07)

Jev 选择了 3。
Jev 针对指定均匀抽样返回的分布
图 5 — 指定的均匀分布与 Jev 返回的选项分布。

这个例子揭示了一个更广泛的问题:模型的输出分布与世界中事件结果的分布不是一回事。这里的实际分布是明确的:1 到 5 的每个整数被选中的概率都是 20%。然而 Jev 给候选 3 分配了 0.50。其输出代表模型对各候选的信念,而非这些结果在世界中的实际分布。一个 API 可以返回精确的小数,却无法返回应用程序实际需要的概率。

这个整数提示是刻意设计的。一个客服路由的例子揭示了同一问题更实际的形态:

过去一年,70% 的来电工单关于计费,30% 关于技术问题。
一个新工单来自相同来源,但其文本尚未打开。这个工单关于什么?

在打开工单前,唯一可用的信息是历史上的 70/30 比例。billing(计费)的可能性更大,但根据提示信息,其概率应保持为 70%,而非接近 100%。

客服工单基准概率与 Jev 返回分布的对比
图 6 — 在未阅读新工单的情况下,Jev 将 70% 的先验放大到 99%。

Jev 选择 billing 并不令人意外。问题在于 0.99。系统尚未获得关于此特定工单的任何证据,模型却将 70% 的先验变成了近乎确定性。这个数字表达的是 Jev 在候选答案中的偏好;它不能用作此工单属于 billing 的实际概率。

RLCD (https://typesafe.ai/blog/introducing-system-one-models-and-jev) 旨在解决此问题:使 Jev 的概率反映任务中的不确定性。上述两个例子表明它尚未做得足够好。但 Jev 的概率是否至少比没有 RLCD 的开放模型更稳定?

我回到了爱丽丝与鲍勃的谜题,保持问题和答案含义不变,仅改变答案顺序或标签,然后衡量 Jev 和 Qwen3.6-27B 相应分布的偏移程度。

选项顺序和标签扰动下 Jev 和 Qwen 的分布偏移
图 7 — “跨顺序”比较不同答案顺序;“跨标签”比较不同选项标签。点表示均值,粗线延伸至第 95 百分位,端帽显示最大值,空心圆显示重复相同提示之间的平均距离。Qwen 使用禁用思考时的 next-token 标签概率。

在答案顺序改变时,Jev 更稳定。标签变化平均导致的偏移类似,但 Jev 也更不容易出现大幅波动。在这个测试中,当问题含义保持不变时,RLCD 使 Jev 的概率分布更稳定。这才是关键的比较:不是哪个模型在复杂基准上回答了更多问题,而是当任务本身未改变时,哪个模型返回的概率更稳定。前者测试推理能力;后者更接近 RLCD 旨在解决的问题。

智能体可能需要信念状态,而不仅仅是行动

当概率参与控制流时,变得更加有趣。许多智能体工作流可以简化为同一个循环:

sₜ → 模型 → aₜ → 环境 → sₜ₊₁

在每一步,模型选择一个动作——通常是概率最高的候选。但该动作背后的分布也很重要:P(aₜ | sₜ)。两次调用可能都选择 A,但 P(A)=0.9 和 P(A)=0.3 不应驱动相同的工作流。第一个分布几乎将所有概率集中在 A 上。在第二个中,A 可能仍然排名第一,但其他选项合计持有 70% 的概率。在开放任务中,系统应将这些替代方案作为值得探索的方向保留下来。如果智能体只执行 A,这种区分就消失了。

AutoResearch 是此类开放任务的例子。智能体不执行预定义的实验序列,而是提出假设、设计实验来验证它们,并在研究方向上分配有限的时间和计算资源。每个结果可以消除一个方向、增强另一个方向,或建议一个新的方向。

假设一个智能体正在试图改进一个验证分数已停止上升的模型。它可能探索数据质量、学习率或模型架构。最新分数显示实验是否有进展,但并未揭示每个方向还有多少潜力。智能体必须在每次结果后修正这一判断。

概率编程为这一过程提供了自然的表示。工作流保持多个假设存活,并随着证据到来更新它们的权重。这些权重共同构成了智能体的信念状态。Jev 可以为已定义的假设或实验选择打分;当智能体需要新的假设时,LLM 可以先提出。Jev 提供局部概率;信念层则跨实验承载不确定性。

一个分布是快照。概率程序说明每个新结果应如何改变下一个决策。

实验结果如何改变 AutoResearch 智能体的信念
图 8 — AutoResearch 分支为竞争的假设和实验。每个结果随后重新调整这些方向的权重,改变智能体下一步应尝试什么——或是否应该停止。LLM 提出候选,Jev 为已定义的选项评分,信念层跨回合承载不确定性。

这改变了“最佳下一个实验”的含义。智能体无需选择最可能立即提高分数的实验。一个实验可能因其能区分两个相互竞争的解释而变得有价值。相反,当另一次运行不太可能学到足够多或改进足够多以证明其成本合理时,智能体可以停止。Jev 不提出新的研究方向,但它让智能体避免过早投入一个方向。

决策值得再次成为一等设计问题

Jev 既不是一种神秘的新模型,也不是新包装的 BERT。围绕它的关注来自一个更实际的压力:LLM 功能强大,但调用成本高昂。对于试图将 AI 投入生产的公司而言,分类、路由和状态更新并非都需要相同的模型。每种工作负载在能力、延迟和成本之间都需要不同的权衡。

从这个角度看,Jev 更像是一次复兴,而非倒退。它并未让我们回到为每个任务训练一个单独 BERT 的时代。它保留了预训练的通用性,同时在应用不需要生成时放弃了生成能力。一旦决策有了自己的接口,专用分类器可以处理熟悉的流量,通用决策模型可以覆盖开放的中间地带,而推理模型则接收那些真正需要推理的案例。成本和不确定性决定了每个输入传输的深度。

它使决策再次成为一等设计问题。

相似文章

体验Jev——一种有趣的AI代理方法

Reddit r/ArtificialInteligence

作者讨论了尝试使用Jev,这是一种专注于决策的AI代理工具,与使用大型语言模型处理所有任务相比,它声称在速度和成本上有显著优势。

Jev / TypesafeAI 在 LLM 领域堪称革命性

Reddit r/ArtificialInteligence

Jev 是一种新型 AI 模型,它输出评分、选择或二元决策,因其在创意查询时的速度、经济性和准确性而备受赞誉,不同于传统的前沿模型。