small-language-model

标签

Cards List
#small-language-model

我从零开始训练了一个75M参数的LLM,使用18B tokens,它击败了几乎两倍大小的模型

Reddit r/LocalLLaMA ↗ · 2026-06-02

从零开始训练了一个名为KeyLM的75M参数LLM,使用18B tokens,在指令跟随得分上与更大模型竞争,同时使用更少的参数和更少的数据。

0 人收藏 0 人点赞
#small-language-model

OpenBMB 发布 MiniCPM5-1B 大语言模型。目前同尺寸下最强大的大语言模型之一。(在 Artificial Analysis Intelligence Index 上得分为 17.9)

Reddit r/singularity ↗ · 2026-05-27 缓存

OpenBMB 发布 MiniCPM5-1B,这是一款领先的 1B 参数开源权重大语言模型,在同尺寸类别中取得了 Artificial Analysis Intelligence Index 最高分(17.9),超越了 Qwen3.5 2B 等更大模型,而使用的参数更少。

0 人收藏 0 人点赞
#small-language-model

@AdinaYakup: MiniCPM5-1B 是 1B 参数级别中的一款令人印象深刻的发布!@OpenBMB https://huggingface.co/collections/openbmb/minicpm5… 1B …

X AI KOLs Following ↗ · 2026-05-25 缓存

MiniCPM5-1B 是 OpenBMB 推出的全新 1B 参数 AI 模型,具有 Think/No-Think 模式的混合推理能力、128K 上下文窗口、Apache 2.0 许可证,并可在多种硬件上运行。

0 人收藏 0 人点赞
#small-language-model

@ModelScope2022: MiniCPM5-1B 现已完全开源,包含权重、训练数据和部署代码。1B参数,在Artificial Analysis上排名第一…

X AI KOLs Following ↗ · 2026-05-25 缓存

MiniCPM5-1B 已完全开源,包含权重、训练数据和部署代码;它在2B以下模型中取得最高评分,并可在边缘设备上运行。

0 人收藏 0 人点赞
#small-language-model

[新发布] Supra-50M 正式推出!

Reddit r/LocalLLaMA ↗ · 2026-05-22

SupraLabs 发布了 Supra-50M,一个紧凑的 5000 万参数因果语言模型,包含基础版和指令版,基于 fineweb-edu 的 200 亿个 token 训练,在多项关键基准测试中达到了可与 GPT-2 和 SmolLM 等更大模型竞争的水平。

0 人收藏 0 人点赞
#small-language-model

@Sapient_Int: 推出 HRM-Text。一个超精简的 1B 参数推理语言模型,旨在提供强大的通用性能…

X AI KOLs Timeline ↗ · 2026-05-18 缓存

Sapient Intelligence 推出 HRM-Text,这是一个 1B 参数的推理语言模型,仅使用 40B tokens 训练,预算为 1000 美元,在大幅减少数据和计算需求的同时实现了具有竞争力的性能。

0 人收藏 0 人点赞
#small-language-model

@_vmlops: 微软的FARA-7B可以为你使用电脑 7B参数...自主点击、滚动、填写表单、订票等

X AI KOLs Timeline ↗ · 2026-05-18 缓存

微软发布了Fara-7B,一个70亿参数的小型语言模型,可以自主控制电脑执行点击、滚动、填写表单等任务,在设备上运行,并在基准测试中击败了OpenAI的computer-use agent等更大模型。

0 人收藏 0 人点赞
#small-language-model

@DJLougen: 致训练这个 @Microsoft 的人,愿上帝保佑你,你的灵魂,这结合 browserOS 太令人印象深刻了

X AI KOLs Timeline ↗ · 2026-05-14 缓存

微软发布了 Fara-7B,一个拥有70亿参数的用于计算机操作的智能小型语言模型,在其规模模型中实现了最先进的性能,并与大型系统竞争。

0 人收藏 0 人点赞
#small-language-model

Needle:我们将 Gemini 的函数调用能力蒸馏进了一个 2600 万参数的模型

Reddit r/LocalLLaMA ↗ · 2026-05-12

Cactus-Compute 发布了 Needle,这是一个拥有 2600 万参数的开源模型,从 Gemini 蒸馏而来。它采用一种不含 MLP 的新型“简单注意力网络”架构,旨在实现高效的端侧函数调用。

0 人收藏 0 人点赞
#small-language-model

@ash_csx:本周我们将发布两款开源 SLM。1. 其中一款体积缩小高达 93 倍,精度仍媲美 SOTA。2. 另一款……

X AI KOLs Following ↗ · 2026-05-11 缓存

两款全新的开源小语言模型即将发布:其中一款体积缩小高达 93 倍,精度仍达到 SOTA 水平;另一款则超越了 OpenAI 近期发布的模型。首款模型将于明日发布。

0 人收藏 0 人点赞
#small-language-model

@AdinaYakup: MiniCPM V4.6 一个真正能在手机上运行的 1B 多模态大语言模型,由 @OpenBMB 刚刚发布 1B - Apache2.0 支持 iOS、Android,…

X AI KOLs Following ↗ · 2026-05-11 缓存

OpenBMB 发布了 MiniCPM V4.6,这是一个专为移动设备优化的 1B 参数多模态大语言模型,采用 Apache 2.0 许可证。它具备混合视觉 token 压缩功能,声称在 iOS、Android 和 HarmonyOS 上原生运行时,吞吐量比 Qwen3.5 0.8B 快约 1.5 倍。

0 人收藏 0 人点赞
#small-language-model

DR-Venus:仅用1万开源数据打造边缘级前沿深度研究智能体

Hugging Face Daily Papers ↗ · 2026-04-21 缓存

DR-Venus-4B 是一个40亿参数的深研智能体,仅利用1万条开源样本,通过「智能体SFT+回合级奖励RL」训练,在多项研究基准上超越以往90亿以下模型,逼近300亿级系统,且可部署于边缘设备。

0 人收藏 0 人点赞
#small-language-model

@zhijianliu_: DFlash for Qwen3.6-35B-A3B 刚刚发布,我们还没完成训练,社区就已经在跑首日预览版了。N…

X AI KOLs Following ↗ · 2026-04-20

Z-lab 发布适用于 Qwen3.6-35B-A3B 的 DFlash 模型微调/压缩技术,训练已全部完成,权重现已在 GitHub 和 HuggingFace 上提供。

0 人收藏 0 人点赞
#small-language-model

Cactus-Compute/needle

Hugging Face Models Trending ↗ · 2026-03-16 缓存

Cactus-Compute 发布了 Needle,这是一个从 Gemini 3.1 蒸馏而来的 2600 万参数模型,采用纯注意力架构,针对设备端推理和本地微调进行了优化。

0 人收藏 0 人点赞
#small-language-model

microsoft/Fara-7B

Hugging Face Models Trending ↗ · 2025-10-30 缓存

微软发布了Fara-7B,这是一个高效的70亿参数智能小型语言模型(SLM),专为计算机使用任务设计,在其参数规模内实现了最先进的性能,并且与更大的系统相比具有竞争力。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈