32个本地模型正面交锋
摘要
一项对32个本地语言模型在事实提取语料库上的正面交锋评估发现,大多数模型在统计上难以区分,而LFM2.5模型尽管规模更大,表现却显著更差。
我在一个事实提取语料库(1,001条笔记)上对32个本地模型进行了正面交锋测试,对每一对相邻模型进行了配对自助法检验。总共花费了数周的计算时间,全部在消费级显卡上完成。大多数模型之间无法区分。从2B到31B的六个连续规模台阶,自助法甚至无法对任何一对相邻模型进行排序。前两名之间也没有显著差异:同一家族的35B MoE模型和27B密集模型,差值为-0.0106,置信区间[-0.0294, +0.0088]。LFM2.5是个例外,但方向相反。它两天前刚发布,却输给了比自己小得多的模型。LFM2.5-8B-A1B得分为0.5198,LFM2.5-2.6B得分为0.5854,而2B的gemma-4-E2B得分为0.6406。E2B最差的量化版本仍有0.6017的得分,超过了这两者。https://rakuensoftware.com/blog/local-llm-fact-extraction-head-to-head
相似文章
我测试了32个模型的提取能力,结果令人惊讶
一位开发者对32个本地模型在智能体记忆的事实提取上进行了基准测试,表明F1分数掩盖了一个关键失败模式:分数相近的模型在“应输出空结果”的输入上编造事实的频率差异巨大。文章认为,智能体记忆评估必须包含空输出和撤回(retraction)案例。
大型语言模型有多像人类?一个关注语域的语言评估框架
本文提出了一种关注语域的语言评估框架,通过使用最大均值差异(MMD)比较人类与LLM生成文本中67个词汇语法特征的分布,来评估大型语言模型(LLM)的人类相似度。在七个经过指令微调的开源模型和五个语域上的实验表明,没有模型能完美匹配人类基线,且与人类语言的接近程度因语域而异,而非模型规模。
本地文本到图像模型对比:终极测试。
用户使用192个提示词对本地文本到图像模型进行了全面对比,评估了文本渲染、人脸、人体解剖、空间构图等能力,结果和提示词已在imagebench.ai上公开。
@cjzafir: 垂直语言模型(VLMs)正在击败顶级大语言模型。这些参数量7B到15B的小型专精模型在各自的细分领域击败了SoTA模型……
作者演示了,通过使用开源模型和Codex编排进行高性价比微调,小型垂直语言模型(6B-15B)能够在细分基准上超越顶级大语言模型,仅用价值300美元的数据集就取得了成果。
LiquidAI/LFM2.5-ColBERT-350M
LiquidAI 发布 LFM2.5-ColBERT-350M,这是一种后期交互多语言检索模型,同时还有一个密集双编码器变体,两者均基于 LFM2.5-350M-Base,支持 11 种语言,并设计为 RAG 管道的即插即用替代品。