LabyrinthBench:一个本地优先、无需裁判的LLM基准测试,用于衡量多步骤智能体任务中干扰下的上下文记忆。

Reddit r/LocalLLaMA 工具

摘要

LabyrinthBench是一个本地化、无需裁判的LLM基准测试,能够确定性地衡量多步骤智能体任务中干扰下的上下文记忆。初步实验表明,清空上下文并重新注入门控答案对9个模型中的7个有帮助,但对2个适得其反,凸显了上下文管理策略的复杂性。

LabyrinthBench衡量的是真正让长时间智能体运行崩溃的问题——模型是否仍能使用它在二十轮前学到的信息——而且是确定性地衡量,无需LLM裁判,在你自己的硬件上运行,并配有可替换的测试框架,用于测试你认为能解决该问题的任何上下文管理策略。 第一个登记的实验让我在两个方向上都感到惊讶:同一个上下文技巧提升了七个模型,却让两个模型崩溃。两条命令加一个浏览器标签页,就能在你自己的机器上实时运行。还有一个排行榜——策略赛道是开放的,我很想看到有人击败我的策略。 我觉得几乎所有认真使用过AI一段时间的人都遇到过这种场景:你和AI制定了一个绝妙的计划,并且已经完成了大部分——然后撞上了上下文限制。你不情愿地点击“压缩”或等效操作继续下去,最终一切都脱离了正轨,因为压缩移除了某个承重的东西。“是时候坦白了。你明确告诉我不要那样做,但我还是做了。”这是不幸常见的用户体验,个人来说,事后我只想看看能把键盘扔多远。 我想客观、确定性地测量那里到底发生了什么。而且我极其厌恶的是,目前对AI进行基准测试居然需要另一个推理实体来打分、评级和评判。我们在课堂和实验室里花费了整整几十年(如果不是几个世纪的话)来构建标准化、客观的评分方法。以正确的方式提出正确的问题,接受概率性输出,你就根本不需要裁判。如果有办法客观、确定性地测量某件事,我们为什么还要满足于主观、概率性地测量它呢? 所以我把模型放进一个迷宫,让它找到出口。迷宫本身并不新鲜;把导航与简单的、确定性评分的问题以及不同的上下文管理策略结合起来,一些非常有趣的事情就开始显现。迷宫是第一版——死胡同、循环陷阱、一个出口——配有一些简单的独立门控,比如 Calculate: 38 + 17 和 Evaluate: NOT(FALSE OR FALSE)。它有效,但在记忆得到测试之前,导航已经压垮了较小的模型;与其构建一个更大的框架来帮助它们导航,我暂时把导航完全去掉了。 第二个地图家族是一条直线型的20门控走廊,问题改为链式衔接:门控1是 Calculate 3 + 4,到后半段你会遇到类似“用上一门控的答案减去你的c1b答案”这样的门控——每个后续门控都会回溯到某个特定的早期答案,因此模型必须按需回忆它做过的任何事情。而由于干净的回忆仍然属于简单情形,第三个地图家族会暗中改变数值:变量A初始化为3。A的值是多少?……然后,几个门控之后,E变了:E现在是4……然后同一个你之前回答过的问题,中间发生过变化——请重新计算,不要复用。导航 → 保持 → 时效。每个地图的存在都是因为前一个地图回答了自己的问题。(每个家族的示例问题:https://labyrinthbench.ai/data/questions ——发布地图是开放的练习集;比赛实例每个赛季全新生成并密封。) 第一个实验:13个本地模型在20门控走廊上跑了两遍——一遍保留完整聊天历史,一遍每轮清空上下文,只重新注入模型自己记录的门控答案。每个模型每种条件跑6次;通过标准(中位深度提升5个门控或以上)在任何清空上下文的运行产生之前就已锁定。 https://preview.redd.it/gdyyt3h33yhh1.png?width=1280&format=png&auto=webp&s=8d50e9d21f518bae1669a8aac353c77cfc644f67 清空上下文在9个有提升空间的模型中赢得了7个——并在另外2个上适得其反。(13个模型中其余4个已经跑到了地图的天花板,无法再体现出增益——它们有自己登记的后续实验;该简要说明在数据附录中。)deepseek-r1:70b 的中位数从1提升到20:它的6次对照运行中有5次恰好通过一个门控;清空上下文后,6次全部通关。glm-4.7-flash 和 qwen3:14b 的中位数都提升了15.5个门控;7个胜者中有4个从通关0–33%的运行提升到83–100%。清空上下文将 qwen3:14b 提升到20/20的中位数——与120B级模型在该地图上无需帮助即可达到的天花板相同。两个反向案例:llama3.3:70b 的中位数从15跌到9;llama4:scout 从10跌到7。参数数量无法预测方向——增益最大和损失最大的都是70B模型。追踪记录解释了其中一个模型的原因:重新注入的答案不带有任何关于之前失败的信息,llama3.3:70b 在每次清空上下文的运行中都耗尽全部四条命,反复提交相同的错误答案。而在保留完整历史时,它从不这样做。成本也被测量了——胜者将每门控的轮次降到对照组的0.11–0.42倍,不过有一个模型为它的深度支付了21倍的输出token。另外还有一个以标志位而非结论形式推出的功能:--look-gate,因为告诉模型在回答前先观察几乎没什么用(中位数4.5 → 5.5,处于噪声范围内),而强制它观察则让同一个模型达到21+且零猜测——完整简要说明在数据附录中。 这一点至今仍让我有点惊叹。云端模型需要API密钥,目前还需要一个前置代理(见FAQ)。要在排行榜上注册运行需要git。非标准安装可能需要调整.env文件。但如果你在本地运行模型,只想看看本地模型表现如何?你不需要注册账号。不需要API密钥、git或.env修改。只需要一台能运行AI模型的硬件和LabyrinthBench的docker compose文件。我提供的清空策略显然并非在所有地方都能获胜。我期待有人用他们自己的框架击败我的尝试——我自己也有几个改进想法。单靠一次幸运的运行也不可能登顶排行榜:排名是一个保守的统计界限(中位深度的单侧95%自助法下置信界),所以让你上升的是证据,而不是方差。一切都是公开的:代码仓库、完整简要说明、带有锁定日期的预注册、原始运行日志和排行榜。仓库:https://github.com/owl-fleet/labyrinth-bench · 排行榜:https://labyrinthbench.ai · 数据:https://labyrinthbench.ai/data
查看原文

相似文章

长上下文LLM中的位置失败:推理基准测试的盲点

arXiv cs.CL

本论文识别出长上下文LLM推理基准测试中的一个盲点:它们未能控制任务在上下文中的位置,导致位置失败未被检测到。作者提出上下文旋转评估(CRE)来系统地改变任务位置、填充内容和上下文长度,揭示出当推理任务放置在长上下文中时,某些模型的准确率会严重下降。

LLM Ass Bench

Hacker News Top

LLM Ass Bench 是一个用于评估大型语言模型的基准测试工具,专注于提示词。