32个本地模型正面交锋

Reddit r/LocalLLaMA 新闻

摘要

一项对32个本地语言模型在事实提取语料库上的正面交锋评估发现,大多数模型在统计上难以区分,而LFM2.5模型尽管规模更大,表现却显著更差。

我在一个事实提取语料库(1,001条笔记)上对32个本地模型进行了正面交锋测试,对每一对相邻模型进行了配对自助法检验。总共花费了数周的计算时间,全部在消费级显卡上完成。大多数模型之间无法区分。从2B到31B的六个连续规模台阶,自助法甚至无法对任何一对相邻模型进行排序。前两名之间也没有显著差异:同一家族的35B MoE模型和27B密集模型,差值为-0.0106,置信区间[-0.0294, +0.0088]。LFM2.5是个例外,但方向相反。它两天前刚发布,却输给了比自己小得多的模型。LFM2.5-8B-A1B得分为0.5198,LFM2.5-2.6B得分为0.5854,而2B的gemma-4-E2B得分为0.6406。E2B最差的量化版本仍有0.6017的得分,超过了这两者。https://rakuensoftware.com/blog/local-llm-fact-extraction-head-to-head
查看原文

相似文章

我测试了32个模型的提取能力,结果令人惊讶

Reddit r/AI_Agents

一位开发者对32个本地模型在智能体记忆的事实提取上进行了基准测试,表明F1分数掩盖了一个关键失败模式:分数相近的模型在“应输出空结果”的输入上编造事实的频率差异巨大。文章认为,智能体记忆评估必须包含空输出和撤回(retraction)案例。

大型语言模型有多像人类?一个关注语域的语言评估框架

arXiv cs.CL

本文提出了一种关注语域的语言评估框架,通过使用最大均值差异(MMD)比较人类与LLM生成文本中67个词汇语法特征的分布,来评估大型语言模型(LLM)的人类相似度。在七个经过指令微调的开源模型和五个语域上的实验表明,没有模型能完美匹配人类基线,且与人类语言的接近程度因语域而异,而非模型规模。

本地文本到图像模型对比:终极测试。

Reddit r/LocalLLaMA

用户使用192个提示词对本地文本到图像模型进行了全面对比,评估了文本渲染、人脸、人体解剖、空间构图等能力,结果和提示词已在imagebench.ai上公开。

LiquidAI/LFM2.5-ColBERT-350M

Hugging Face Models Trending

LiquidAI 发布 LFM2.5-ColBERT-350M,这是一种后期交互多语言检索模型,同时还有一个密集双编码器变体,两者均基于 LFM2.5-350M-Base,支持 11 种语言,并设计为 RAG 管道的即插即用替代品。