标签
作者分享了使用 LFM 2.6B 的亲身经历,这是一款为手机设计的小型模型,作者称赞其速度和完成快速任务的实用性,例如摘要和自动补全,不过它只有 128k 的上下文限制。
InclusionAI(蚂蚁集团实验室)发布了Ling 3.0 Tiny,一个封闭API模型,总参数7.9B中激活1.3B,支持256K上下文、原生函数调用,并具备思考/即时模式,面向多轮智能体工具循环。文章质疑其效率曲线,并指出尚无独立评测或开放权重。
Liquid AI 发布了 LFM2.5-2.6B,这是一个 2.69B 参数模型,支持 128K 上下文和工具调用,专为多步骤智能体工作流优化,可在手机上以 30 tok/s 运行,Q4_K_M GGUF 文件约 1.67GB。不过,与更大的模型相比,其在编码和知识密集型任务上仍然较弱。
用户询问关于 Mach-1 Additive 的情况,据称该模型在体积小10倍的情况下,实现了 Qwen 3.6 35B 95% 的性能,并质疑为什么它没有得到更广泛的讨论。
Liquid AI 发布了 LFM2.5-2.6B,一款专注于智能体能力的新型小模型。作者很期待测试它在文档摘要等大规模任务中的表现。
SupraLabs 发布了 SupraBrain-50M,这是一种混合语言模型,结合了 Gated DeltaNet、滑动窗口注意力(Sliding-Window Attention)和惊喜门控(Surprise-Gated)机制,尽管训练使用的 token 数量少得多,但性能与 Supra-Base-50M 几乎持平。
Liquid AI的后训练主管解释了如何使用LFM2.5、on-policy偏好对齐、智能体RL、课程训练和迭代模型合并,在20分钟内构建一个小于1GB的设备端模型,其工具调用可靠性超越了更大的模型。
WorldDiT 是一个新型的小型(<1B 参数)机器人模型,统一了世界预测与控制,在 LIBERO 基准测试中取得顶级性能,无需 VLM。
Neutrino-1 8B是一个拥有8.19B参数、采用专有三值权重格式的Transformer模型,使其能够部署在8GB显存的GPU上,并从一个仅3.88GB的模型文件中以高解码速度服务多个平台。
DeepLens诊断代理采用五阶段智能体工作流,结合小型医疗推理模型(7B),在包含915个病例的基准测试中实现了60.14%的诊断准确率,以更低成本超越了Claude Sonnet 4.5和Gemini 3.1 Pro等前沿大语言模型。仅工作流设计就比基础模型提升了36个百分点,表明结构化流程约束对于诊断推理至关重要。
Semalith v1.4是一种紧凑型184M参数DeBERTa-v3安全分类器,在良性代理提示上实现零误报的提示注入检测方面表现出色,同时还能在单次处理中覆盖一般危害和金融合规,以少44倍的参数优于Llama-Guard-3-8B。
Shieldstral 是一个 3B 参数的多模态安全分类器,通过将内容审核表述为二值问答任务,在安全基准测试中实现了最先进的性能,匹配或超越近 7 倍于其规模的模型。
一位用户讨论了在配备统一内存的MacBook Pro上运行大型LLM时产生的高热量问题,质疑其他人是持续运行这些模型还是仅用于基准测试,并寻求适合持续运行代理任务的小型模型推荐。
一个个人项目,使用Fineweb-edu数据集中的10亿个token训练了一个0.5M参数的语言模型。
Poolside 发布了 Laguna S 2.1,这是一个 118B 参数的混合专家模型,每个 token 激活 8B 参数,拥有 1M 上下文窗口,声称可以击败体积是其三倍的模型,例如 DeepSeek v4 Pro、Gemini 3.6 Flash 和 Thinking Machines Inkling。
用户测试了 agents-a1-4b 模型,指出其对话质量堪比 30B 参数模型,感觉自然且连贯。
构建了 Mira Mini,这是 Mira 的首次复现,在一周内完成,拥有 3.64 亿参数,支持四位玩家在浏览器中玩《Rocket League》,完全开源。
Agents-A1-4B是InternScience推出的一款紧凑型4B参数模型,在多项智能体和推理基准测试中取得了最先进的结果,通过扩展能力而非参数规模超越了更大模型。
本文研究了当一个小型4B参数模型作为设备端研究代理时,其引用的忠实性由何种因素决定,发现更多源文本的暴露能提升忠实性,而检索召回率则限制了覆盖率。