大型语言模型在决策分叉中的表现如何?(GitHub Repo)

TLDR AI 工具

摘要

Taste-Bench 是一个基准测试,评估大型语言模型在长时任务中决策分叉处选择最佳路径的能力,使用来自软件工程和机器学习研究的轨迹,排行榜显示当前顶级模型如 GPT-5.6 Sol 达到 59.7% 的准确率。

Taste-Bench 评估一个 LLM 智能体能否在长时任务的关键分叉处选择更好的下一步。
查看原文
查看缓存全文

缓存时间: 2026/09/25 14:48

wbopan/tastebench 来源:https://github.com/wbopan/tastebench 📄 论文 (https://arxiv.org/abs/2609.25804) | 🤗 数据集 (https://huggingface.co/datasets/wenbopan/taste-bench) | 🏆 排行榜 | 🚀 快速开始

arXiv (https://arxiv.org/abs/2609.25804) 论文页面 (https://huggingface.co/papers/2609.25804) 数据集 (https://huggingface.co/datasets/wenbopan/taste-bench) CI (https://github.com/wbopan/tastebench/actions/workflows/ci.yml) Python 许可证


Taste-Bench 衡量的是大语言模型智能体的“品味”:即在长程任务中遇到真实决策分叉点时,选择更好方向的能力。

给定任务、截至分叉点的轨迹以及两个候选下一步,模型必须选择那个被隐藏的后续轨迹证明是正确的步骤。错误的选择在当下往往看起来合理,但会让智能体在后续付出大部分预算代价。

502 个问题挖掘自软件工程和机器学习研究的轨迹中,无需专家标注,而最好的前沿模型只能正确回答其中的 59.7%。
这是一个来自机器学习轨迹的决策分叉示例。模型在后来的损失揭示 A 方案更好之前做出选择。

排行榜

一个问题只有在模型以两种选项顺序都回答正确时才被计为正确,因此随机猜测得分为 25,而总是选择同一位置的模型得分为 0。

平均分是研究子集和工程子集 1:1 的均值。

模型平均D-工程D-研究P-工程P-研究未解析
GPT-5.6 Sol59.748.167.275.856.20
GPT-5.559.547.468.873.456.20
Claude Opus 555.535.364.171.064.60
Grok 4.554.647.757.861.356.210
GPT-5.6 Terra54.040.657.870.258.30
GLM-5.253.940.259.464.560.417
Claude Sonnet 551.636.160.962.156.20
GPT-5.6 Luna49.032.357.867.750.00
MiniMax M345.334.639.164.556.23
DeepSeek V4 Flash43.329.346.958.150.02
GPT-5.4 Mini40.125.254.726.654.2112
Mistral Medium 3.537.740.628.143.541.724
GPT-5.4 Nano36.625.639.146.043.893
Grok 4.20 Reasoning15.719.99.428.28.3459

D = 绕行分叉,P = 并行分叉;工程 = 工程(390 题),研究 = 研究(112 题)。1,004 个未解析的回答均计为错误。所有行均使用 paired_order_v1 协议,2026 年 8 月。
要添加模型,请运行完整协议,并在其 results/<model>/ 目录下提交 summary.json 的摘要拉取请求。

问题是如何构建的

轨迹的后半部分是分叉点决策的事后验证证据,因此轨迹本身就构成了标签。问题有两种构造方式和两个领域。

  • 并行分叉。 对同一任务的独立尝试在同一点分叉,并以不同的记录结果结束。每次尝试的结果标记了更好的方向。
  • 绕行分叉。 智能体选择一个方向,在观察到失败后放弃,并在同一运行过程中恢复。被放弃的方向和后来的恢复步骤构成候选选项。
  • 过滤。 如果仅凭候选描述就能让所有评判模型回答该问题,则该问题因过于简单而被丢弃;如果任何评判模型在阅读完整记录后与标签不一致,则该问题因无法判定而被丢弃。

在 4,657 个挖掘出的分叉中,502 个得以保留:工程领域(SWE-bench 和 SWE-bench Pro 运行)有 266 个绕行分叉和 124 个并行分叉;研究领域(METR 的 MALT 版 RE-Bench 和 HCAST 运行)有 64 个绕行分叉和 48 个并行分叉。

示例问题(并行分叉,工程)

任务。 修改 NodeBB 生产源代码,使管理员文件上传端点在保存前验证请求的文件夹。使用配置的 nconf.get('upload_path') 作为其基础来解析文件夹,用 [[error:invalid-path]] 拒绝缺失或非目录的目标,并防止路径逃逸出上传根目录。

进展。 30 个记录步骤:智能体已检查测试框架、找到管理员上传控制器及其测试,并阅读了周围的文件辅助函数。

A. 添加一个专注的文件夹存在性辅助函数,该函数在配置的上传根目录下解析目标并验证其是否为目录。在调用保存辅助函数之前,用 [[error:invalid-path]] 拒绝无效目标,并删除临时上传的文件。

B. 在控制器现有的保存 try/catch 块中内联上传根目录包含性和目录状态检查。对无效目标抛出 [[error:invalid-path]],并让现有的 catch 通过 next 转发错误。

对模型隐藏:A 是正确的。选择 A 方案的尝试通过了隐藏测试;B 转发了错误但没有清理临时上传,其尝试失败。

评估协议

在 protocol/paired_order_v1.yaml 中指定。模型看到任务、作为 prefix_text 发布的决策前完整轨迹(凭据和用户名已编辑,64K token 预算,溢出时有明确省略标记)以及两个候选步骤。

提示要求一行,格式为 ANSWER: X,无可见的思维链。每个问题都以发布的选项顺序及其精确反向顺序提问一次,每次字母重新计算。分母是所有已发布的问题,请求错误和无法解析的输出均计为错误。tb validate 检查发布哈希和每个问题的不变量。

快速开始

数据集设置了访问限制以减少训练污染:在其 Hugging Face 页面(https://huggingface.co/datasets/wenbopan/taste-bench)申请访问权限,然后运行一次 hf auth login。

git clone https://github.com/wbopan/tastebench && cd tastebench && uv sync
uv run tb download          # wenbopan/[email protected] 到 ./data
export TASTEBENCH_API_KEY=...  # 任何 OpenAI 兼容的端点
uv run tb run --model gpt-5.5 --api https://api.openai.com/v1/chat/completions
uv run tb score runs/gpt-5.5/  # 打印每个单元格的准确率和平均分

tb run 每个问题和顺序写一条记录,可断点续传,并可使用 --limit N 进行冒烟测试。完整运行包含 1,004 次请求和约 8M 输入 token。每个模型的请求设置位于 configs/models.yaml。

数据本身是两个 parquet 配置,engineering(390 行)和 research(112 行),各有一个 test 分片。一行包含 query、完整的 prefix_text、发布顺序的两个 choices 和 answer 字母,以及 cell、task_id 和一个污染探测字段。无需本仓库即可加载:

from datasets import load_dataset
rows = load_dataset("wenbopan/taste-bench", "engineering", split="test", revision="v1.0")

引用

@article{pan2026tasteful,
  title   = {The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks},
  author  = {Pan, Wenbo and Liu, Zhichao and Liu, Shujie and Zeng, Jingying and Lin, Chin-Yew and Tang, Xianfeng and Lu, Yan and He, Qi and Jia, Xiaohua},
  journal = {arXiv preprint arXiv:2609.25804},
  year    = {2026}
}

轨迹来自 SWE-bench、SWE-bench Pro 和 METR 的 MALT 版本。代码在 MIT 许可证 下发布,数据集文本在 CC BY 4.0 下发布。

相似文章

LLM 排名并非阶梯:来自传递性基准图的实验结果 [D]

Reddit r/MachineLearning

作者介绍了 LLM Win,这是一个将大语言模型(LLM)基准测试结果可视化为有向图的工具,用于分析传递关系和排名逆转。实验结果表明,LLM 的排名更像是一个具有较高弱到强可达性的能力图,而非线性阶梯。

DLawBench:通过多轮法律咨询评估大语言模型

arXiv cs.CL

DLawBench是一个新的基准测试,用于评估大语言模型在多轮法律咨询中的表现,涵盖中国和美国法律,包含四种客户类型。实验表明仍有很大改进空间,最佳模型在法律推理上仅达到0.562。

选择大语言模型擅长与不擅长的任务

Reddit r/AI_Agents

该文章强调,大语言模型在处理模糊判断任务方面表现卓越,但在执行一致性计算时表现平平,因此主张在多智能体系统中实现任务专门化。