我在小型本地模型上测试了成熟的编排技术:90%失败,幸存下来的10%让任务完成率翻了约一倍。

Reddit r/LocalLLaMA 新闻

摘要

一位Reddit用户分享了在小型本地LLM上测试成熟编排技术的结果,发现90%失败了,但幸存下来的10%在LFM 1.2B和Gemma 4 26B-A4B等模型上将任务完成率大约翻了一倍。

Hey localllama 的兄弟们,最近怎么样?我是 u/raydestar,一个长期的本地 LLM 爱好者。我是一名有约 10 年经验的软件工程师(SWE),最近一直在拼命努力提升 agentic AI 的技能。自从开放权重模型变得好用以来,这真是太让我震撼了。一直让我难以理解的是:“为什么这没有被更大规模地重视?”我认为答案是,它还不够普及,而且大多数人认为 8B 模型根本不足以完成大多数任务。而且——把模型丢进 LM Studio 然后打开——它用起来*感觉*就不像是一个好模型。但我认为人们没有意识到,这些都是可以用好的代码解决的工程问题。 我的使命是证明:1) 本地 LLM 可以用于完成 >80% 的任务。(这里还没有证明——那是长期目标。这篇帖子只是第一个数据点。)2) 有了良好的编排,即使是小型 LLM 也能感觉像大模型一样。3) 有了合适的工具,即使是小型模型也能解决我们嘲笑 SOTA 模型解决不了的问题(比如洗车问题)。 我选择的武器是 LFM 1.2B——主要因为在我 4090 上它能跑到 500 t/s。我花了长得有些尴尬的时间才摸清 AI 的最佳实践,所以我想把这些分享给你。我会为你提炼很多内容,因为我讨厌读一大段密密麻麻的文字。我想分享我的过程和结果,如果你对我的思考过程以及我是如何走到这一步感兴趣,点击文末的博客链接即可。你看到的都是开源的,我也不是想卖什么东西。 首先需要明确一点,因为它会改变你解读这些数字的方式:这**不是**一个知识基准测试。我一开始试过——我花了大量时间试图用脚手架(scaffolding)来提高 MMLU 分数,结果很糟糕。脚手架无法告诉模型一个它的权重里没有的事实。它*能*做的是帮助模型真正完成一项任务。所以这项测试是 100 个结果可验证的任务,并且允许测试框架使用工具。我衡量的是任务完成率,而不是召回率。 规则: * 必须拥有经过验证、可重复的数字提升 * 不得以任何方式刷分或作弊(这一点很难坚持——尤其是 Opus 总是试图硬编码响应。它会写一个函数用模式匹配来匹配预期答案,而不是真正解决问题。如果你自己也在做这件事,请阅读模型编写的代码,而不仅仅是它产生的分数。) 我的流程大致遵循了科学方法: * 研究:工具和编排的最佳实践。谦卑(以及大量失败)告诉我,你没有那么聪明,直接用经过验证的架构吧。 * 基准测试:这是一个战斗竞技场,每种方法都在为生存而战。它必须通过 100 个任务库(我也会提供它),同时不能把延迟和 token 成本炸掉,否则就会被丢弃。 * 结果:只保留经过验证的结果。在我尝试的 [N] 种方法中,约 90% 被丢弃,10% 被保留。 发布的结果(这些是缩略版,博客有更多信息): LFM 1.2B(Q4): 15/100 --> 32/100 LFM 2.5 8b(Q4): 24/100 --> 48/100 Gemma 4 26B-A4B(Q4): 23/100 --> 56/100 Luna(low): 22/100 --> 66/100 设置:[后端 / 量化 / 上下文长度 / 温度 + 采样器]。编排成本:与基线相比,大约 [X] 倍 token 和 [Y] 倍墙钟时间——这不是免费的,在 1.2B 上,这种权衡正是关键所在。这些是 [单次运行 / N 次运行的平均值]。Luna 是不稳定的那个——它在多次运行之间波动约 [±Z],所以请把 66 视为范围上限,而不是固定数字。其他模型都保持在了几分以内。 说实话,我本来想用 SOTA 模型做更全面的测试,但我的预算有限。不过我还是很开心,因为这些收益在整体上都成立,不仅仅是我最初测试的 LFM 1.2B 模型。 关于任务库:这 100 个案例是 [手写的 / 从 X 派生的],经过我清理。发布它显然会把它烧成一个封闭集合,所以我[保留一个私有变体用于未来的运行 / 接受这一点,下次重新开始]。污染问题也是我会第一个问的。 还有一个有趣的补充——提高测试分数似乎也大幅改善了前端的响应能力。它在对话中的感觉比以前自然得多,我把这看作一个非常好的预兆。 结论——在衡量已验证完成率的 100 个任务库上,这显示出了非常可喜的早期结果。小型模型并不像开箱即用时感觉的那么笨,它们只是脚手架不足。我会继续做这件事——让本地 LLM 既得到提升,也更便于公众使用。 谢谢!! 博客文章 -- https://markbhall.dev/writing/my-local-llm-scored-6-of-6/ GitHub -- https://github.com/raydeStar/sir-thaddeus (Apache 2) 基准测试 -- https://github.com/raydeStar/local-benchmark-runner-public (Apache 2)
查看原文

相似文章