标签
本文报道了短篇小说创意写作基准测试的最新分数,显示了Opus 5.5、Grok 4.7和Gemini 3.8 Flash等AI模型的改进,排行榜涵盖了56个模型和超过100,000次评估判断。
Terminal-Bench 4.0 版本已发布,更新了数据集和排行榜,包括校准的任务资源、任务修复以及移除饱和任务。