small-language-model

标签

Cards List
#small-language-model

训练了我的第一个小型语言模型

Reddit r/LocalLLaMA ↗ · 5小时前

作者训练了一个小型语言模型来替代Gemini Flash进行摘要任务,达到了97%的准确率和0.06秒的延迟,适合在内部应用中部署。

0 人收藏 0 人点赞
#small-language-model

@NFT_Chen: 什么?!一个仅0.6B的本地开源决策模型在Typed Decisions上超越了Laya!AgentJev-0.6B vs Laya: 准确率…

X AI KOLs Timeline ↗ · 3天前 缓存

AgentJev-0.6B是一个小型开源AI决策模型,在Typed Decisions上超越了Laya,准确率更高,计算量显著减少,实现了更快的本地推理。

0 人收藏 0 人点赞
#small-language-model

尼泊尔法律专长通过生成式和抽取式预训练变压器(NepLEGiT)

arXiv cs.CL ↗ · 2026-09-16 缓存

本文介绍了NepLEGiT,一种专门在尼泊尔法律文本上从头预训练的小型语言模型,旨在提升尼泊尔法律知识的可及性和服务交付。

0 人收藏 0 人点赞
#small-language-model

有人能解释一下'使用系统提示控制推理'是什么意思吗?

Reddit r/artificial ↗ · 2026-09-14 缓存

这篇文章详细介绍了NVIDIA的Nemotron-3-Nano-4B-GGUF模型的发布,这是一款小型语言模型,旨在处理推理和非推理任务,且推理可通过系统提示进行控制。

0 人收藏 0 人点赞
#small-language-model

@akshay_pachaar: 中国研究人员又做到了!OpenBMB刚刚开源了MiniCPM5-2B,一个用于推理的密集2B参数模型……

X AI KOLs Timeline ↗ · 2026-09-11 缓存

OpenBMB已经开源了MiniCPM5-2B,一个2B参数的AI模型,针对资源受限硬件优化,用于推理、编码和工具使用,在其尺寸类别中达到最先进的性能,并展示了有效的本地部署能力。

0 人收藏 0 人点赞
#small-language-model

openbmb/MiniCPM5-2B-GGUF

Hugging Face Models Trending ↗ · 2026-09-05 缓存

发布 MiniCPM5-2B-GGUF,这是一个针对设备端部署优化的20亿参数AI模型,使用开源训练数据集在同类产品中达到了最先进的性能水平。

0 人收藏 0 人点赞
#small-language-model

@nicebabycat: https://x.com/nicebabycat/status/2091726637155103126

X AI KOLs Following ↗ · 2026-08-24 缓存

本文详细测试了Ling-3.0-tiny模型在Apple M5芯片Mac上的本地部署与性能,展示了在无独立显卡时以47 token/s的速度运行7.9B参数模型的可行性。

0 人收藏 0 人点赞
#small-language-model

我从头开发了自己的量化大语言模型,使用300亿个token进行训练,部署大小仅为60 MB [R]

Reddit r/MachineLearning ↗ · 2026-08-22

一位开发者从头创建了一个250M参数的量化大语言模型,使用300亿个token进行训练,可在CPU上以60 MB部署,并采用了一种新颖的基于磁盘的长上下文系统,支持最多1亿个token。

0 人收藏 0 人点赞
#small-language-model

Daedalus-150M:专为CPU推理设计的卷积-注意力混合模型

Hugging Face Daily Papers ↗ · 2026-08-20 缓存

本文介绍了Daedalus-150M,一种结合了卷积和注意力机制的混合语言模型,专为CPU推理优化,在显著更少的训练数据下实现了比更大模型更好的基准性能。

0 人收藏 0 人点赞
#small-language-model

Nanbeige4.2-3B 在 Apple Silicon 上:修复部署 Bug 并减少 Looped Transformer 的内存开销

arXiv cs.AI ↗ · 2026-08-17 缓存

本文讨论了 Nanbeige4.2-3B Looped Transformer 模型在 Apple Silicon 上的部署 bug,并引入了一种内存高效的分块预填充策略以支持 agentic 任务。

0 人收藏 0 人点赞
#small-language-model

Show HN: Needle2:面向手机、可穿戴设备、智能家居和机器人的14MB智能体LLM

Hacker News Top ↗ · 2026-08-10 缓存

Cactus Compute 发布 Needle 2,这是一个45M参数的智能体LLM,压缩为14MB二进制文件,适用于手机、可穿戴设备、智能家居和机器人,在树莓派5上实现每秒500+ tokens,运行内存仅28MB。

0 人收藏 0 人点赞
#small-language-model

LFM2.5-2.6B:随处部署智能体(8分钟阅读)

TLDR AI ↗ · 2026-08-05 缓存

Liquid AI 发布了 LFM2.5-2.6B,这是一款紧凑的智能体模型,设计为完全在设备端运行,从而实现免费推理、低延迟和隐私保护。文章详细介绍了其训练流程,包括 SFT、教师特化、蒸馏和智能体强化学习。

0 人收藏 0 人点赞
#small-language-model

Deploy local agents everywhere with LFM2.5-2.6B

Hugging Face Blog ↗ · 2026-08-04 缓存

Liquid AI releases LFM2.5-2.6B, a compact agentic model designed for on-device deployment, supporting tool calling and multi-step workflows with efficient inference on CPUs and GPUs.

0 人收藏 0 人点赞
#small-language-model

[新模型!] Supra2-100M Base 和 Instruct——快去看看吧!

Reddit r/LocalLLaMA ↗ · 2026-08-03

SupraLabs 发布了 Supra2-100M Base 和 Instruct 模型,这是一个新的小型语言模型系列,包含社区驱动的改进、基准测试和一个 GGUF 版本。

0 人收藏 0 人点赞
#small-language-model

极简RAG模型:B1ade 335M嵌入模型与1B参数小型语言模型

arXiv cs.CL ↗ · 2026-07-31 缓存

介绍了B1ade,一种极简RAG架构,包含一个335M零训练嵌入模型和一个通过GRPO在723M tokens上训练的1B小型语言模型,展示了涌现归因行为,无需大规模预训练即可获得具有竞争力的问答性能。

0 人收藏 0 人点赞
#small-language-model

Nanbeige4.2-3B:在紧凑模式下释放智能体能力

arXiv cs.CL ↗ · 2026-07-27 缓存

Nanbeige4.2-3B 是一个紧凑的 3B 参数通用智能体模型,采用 Looped Transformer 从零开始预训练,在智能体和推理任务上表现出色,在多个基准测试中超越了更大的模型。该模型和代码均已开源。

0 人收藏 0 人点赞
#small-language-model

两种不同规模的智能体AI:Nanbeige4.2-3B与Laguna S2.1(9分钟阅读)

TLDR AI ↗ · 2026-07-27 缓存

比较了两个用于智能体工作负载的新AI模型:采用循环Transformer架构的紧凑型Nanbeige4.2-3B,以及大型混合专家模型Laguna S2.1,两者均在Hugging Face上发布。

0 人收藏 0 人点赞
#small-language-model

OpenLanguageModel: 面向教育与科研的可读可组合小型语言模型预训练

arXiv cs.CL ↗ · 2026-07-21 缓存

OpenLanguageModel (OLM) 是一个开源的PyTorch库,用于构建和预训练小型语言模型,其架构代码可读且可组合,连接了教育与科研。

0 人收藏 0 人点赞
#small-language-model

openbmb 发布 MiniCPM5-2B,目前尚未在 Hugging Face 可用

Reddit r/LocalLLaMA ↗ · 2026-07-20

OpenBMB 发布了 MiniCPM5-2B,一个拥有 20 亿参数的语言模型,目前尚未在 Hugging Face 上架。

0 人收藏 0 人点赞
#small-language-model

小规模语言与视觉语言模型网络代理中GRPO的学习率门控失败:受控零结果及其机制

arXiv cs.AI ↗ · 2026-07-15 缓存

本文研究了GRPO后训练是否能提升小规模(4B-8B)语言与视觉语言模型网络代理的性能。结果发现了一个受控的零结果:没有任何配置能在已掌握任务上带来可信的提升,且中高学习率会导致性能退化或崩溃,揭示了退化与崩溃状态之间的双重分离。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈