标签
Taste-Bench 是一个基准测试,评估大型语言模型在长时任务中决策分叉处选择最佳路径的能力,使用来自软件工程和机器学习研究的轨迹,排行榜显示当前顶级模型如 GPT-5.6 Sol 达到 59.7% 的准确率。