标签
TalkMesh 是一个采用强化学习的小型语言模型智能体去中心化网络,能够学习何时及进行何种通信,在 GSM8K 和 MATH-500 等基准测试中显著优于自洽性方法,显著提升了准确性。
一条推文指出,小型专用分类器可以无需托管部署,并且可以直接在移动设备上训练,突出了轻量级AI模型的进步。
一项仅有400万参数的模型,通过10,000个样本微调,在某些基准测试中性能超越了opus和kimi。
SmolDataEnvs现已发布,这是一套包含5000个可验证RL环境任务的集合,专注于代码和数据科学领域的小型模型训练,完全开源。
本文将基于可验证奖励的强化学习应用于采用检索增强生成的小型语言模型,实现了无需蒸馏的3.8倍性能提升,并强调了针对小型模型进行奖励设计的重要性。
作者讨论了AI模型需要更好的世界知识,利用N-gram技术将更多知识融入更小的模型,并质疑为什么开发更侧重于编码能力而非更广泛的世界知识。
Kev 是基于 Qwen3.5 构建的小型决策模型家族,提供开源训练代码和预训练权重,支持本地部署,并兼容多种问题类型。
本文提供了如何用自己的数据微调小模型的完整指南,涵盖数据采集、清洗、训练、评测和部署,强调数据权利和评测纪律。
文章探讨了更小的量化模型是否正在成为本地AI应用的首选,强调了它们在VRAM使用、性能和功能(如工具调用)之间的平衡。
文章询问是否有比Qwen3.5 4B更好的小型AI模型,用于构建快速的本地助手,重点是在保持速度的同时改进对话、推理、多语言支持和工具调用等能力。
一位用户询问关于参数少于30亿、能够在浏览器环境中或作为扩展高效运行的最佳开源权重大语言模型。
smolbenchmark 是一个新资源,可在消费级硬件设备上对小型 AI 模型进行基准测试,提供速度、能效和散热等指标,帮助用户为其特定硬件选择最佳模型。
本文介绍了循环GPT-BERT,它通过深度方向参数共享来训练参数更少的小型语言模型,在BabyLM 2026严格小规模设定中达到了与基准模型相当的性能。
本文研究了一款用于对话游戏的2B模型的失败案例,并介绍了一种诊断引导的后训练方案,该方案使用SFT、DPO和LoRA来提升性能,同时保持通用能力。
介绍Scaffold CoT,这是一个约400万示例的CoT数据集,通过结构化框架设计,旨在通过提供一致的分类型示例来增强小型语言模型的推理能力。
作者建议使用小型、快速的AI子代理进行上下文工程,以提高AI系统的效率并降低成本,质疑为何这种方法未被广泛采用,并寻求社区反馈。
本文主张企业应通过为不同任务选用适配规模的模型与混合系统来优化AI智能开销,而非对所有应用都默认采用昂贵的前沿模型。
本文介绍了 SocialRL,一种强化学习方法,用于增强小型语言模型中的社会推理能力,使其能够有效谈判,并在多种交互领域中匹配或超越 GPT-5 等大型模型的表现。
Meta最新论文显示,小型模型能够准确预测缩放规律,但需要更全面的超参数调优。研究发现,缩放规律在参数量约400万时开始显现,通过恰当调优其特征会变得更加清晰。