标签
作者训练了一个小型语言模型来替代Gemini Flash进行摘要任务,达到了97%的准确率和0.06秒的延迟,适合在内部应用中部署。
AgentJev-0.6B是一个小型开源AI决策模型,在Typed Decisions上超越了Laya,准确率更高,计算量显著减少,实现了更快的本地推理。
本文介绍了NepLEGiT,一种专门在尼泊尔法律文本上从头预训练的小型语言模型,旨在提升尼泊尔法律知识的可及性和服务交付。
这篇文章详细介绍了NVIDIA的Nemotron-3-Nano-4B-GGUF模型的发布,这是一款小型语言模型,旨在处理推理和非推理任务,且推理可通过系统提示进行控制。
OpenBMB已经开源了MiniCPM5-2B,一个2B参数的AI模型,针对资源受限硬件优化,用于推理、编码和工具使用,在其尺寸类别中达到最先进的性能,并展示了有效的本地部署能力。
发布 MiniCPM5-2B-GGUF,这是一个针对设备端部署优化的20亿参数AI模型,使用开源训练数据集在同类产品中达到了最先进的性能水平。
本文详细测试了Ling-3.0-tiny模型在Apple M5芯片Mac上的本地部署与性能,展示了在无独立显卡时以47 token/s的速度运行7.9B参数模型的可行性。
一位开发者从头创建了一个250M参数的量化大语言模型,使用300亿个token进行训练,可在CPU上以60 MB部署,并采用了一种新颖的基于磁盘的长上下文系统,支持最多1亿个token。
本文介绍了Daedalus-150M,一种结合了卷积和注意力机制的混合语言模型,专为CPU推理优化,在显著更少的训练数据下实现了比更大模型更好的基准性能。
本文讨论了 Nanbeige4.2-3B Looped Transformer 模型在 Apple Silicon 上的部署 bug,并引入了一种内存高效的分块预填充策略以支持 agentic 任务。
Cactus Compute 发布 Needle 2,这是一个45M参数的智能体LLM,压缩为14MB二进制文件,适用于手机、可穿戴设备、智能家居和机器人,在树莓派5上实现每秒500+ tokens,运行内存仅28MB。
Liquid AI 发布了 LFM2.5-2.6B,这是一款紧凑的智能体模型,设计为完全在设备端运行,从而实现免费推理、低延迟和隐私保护。文章详细介绍了其训练流程,包括 SFT、教师特化、蒸馏和智能体强化学习。
Liquid AI releases LFM2.5-2.6B, a compact agentic model designed for on-device deployment, supporting tool calling and multi-step workflows with efficient inference on CPUs and GPUs.
SupraLabs 发布了 Supra2-100M Base 和 Instruct 模型,这是一个新的小型语言模型系列,包含社区驱动的改进、基准测试和一个 GGUF 版本。
介绍了B1ade,一种极简RAG架构,包含一个335M零训练嵌入模型和一个通过GRPO在723M tokens上训练的1B小型语言模型,展示了涌现归因行为,无需大规模预训练即可获得具有竞争力的问答性能。
Nanbeige4.2-3B 是一个紧凑的 3B 参数通用智能体模型,采用 Looped Transformer 从零开始预训练,在智能体和推理任务上表现出色,在多个基准测试中超越了更大的模型。该模型和代码均已开源。
比较了两个用于智能体工作负载的新AI模型:采用循环Transformer架构的紧凑型Nanbeige4.2-3B,以及大型混合专家模型Laguna S2.1,两者均在Hugging Face上发布。
OpenLanguageModel (OLM) 是一个开源的PyTorch库,用于构建和预训练小型语言模型,其架构代码可读且可组合,连接了教育与科研。
OpenBMB 发布了 MiniCPM5-2B,一个拥有 20 亿参数的语言模型,目前尚未在 Hugging Face 上架。
本文研究了GRPO后训练是否能提升小规模(4B-8B)语言与视觉语言模型网络代理的性能。结果发现了一个受控的零结果:没有任何配置能在已掌握任务上带来可信的提升,且中高学习率会导致性能退化或崩溃,揭示了退化与崩溃状态之间的双重分离。