decision-forking

标签

Cards List
#decision-forking

大型语言模型在决策分叉中的表现如何?(GitHub Repo)

TLDR AI ↗ · 昨天 缓存

Taste-Bench 是一个基准测试,评估大型语言模型在长时任务中决策分叉处选择最佳路径的能力,使用来自软件工程和机器学习研究的轨迹,排行榜显示当前顶级模型如 GPT-5.6 Sol 达到 59.7% 的准确率。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈