标签
FutureBridge introduces a token reranker for collaborative decoding that ranks LLM-SLM candidates based on how well the SLM can continue reasoning from them, improving the Qwen3-1.7B SLM's math accuracy by 35.1% over greedy decoding.
作者反思了27B以下的小语言模型是否正被Qwen 3.5和Gemma 4等更大模型所掩盖,并询问社区中有哪些适合智能体编码任务的高性能SLM。
The paper compares five parameter-efficient fine-tuning methods on four small language models for on-device personalization, finding LoRA+ best for energy efficiency and QLoRA best for memory-limited deployment.
介绍了TQLite,一种利用多LRM评审团训练小型语言模型进行基于MQM的实时翻译质量评估的蒸馏框架,其性能远超现成的SLM,同时保持成本效益。
一项系统的跨架构实证研究,衡量小语言模型领域适配的可信度成本,发现安全保持的微调策略并不能可靠地迁移对齐性。
本文提出通过渐进式监督微调和强化学习训练小语言模型作为多智能体路由器,相比仅基于意图路由的LLM基线方法,实现了更好的检索相关性和更低的延迟。
微软研究院重点介绍了关于使用SocialRL进行小型语言模型谈判、PazaBench V2用于非洲语言语音评估、EvoLib帮助智能体从经验中学习、改进的A/B测试方法以及AI驱动的精准肿瘤学的新研究。
Data Turnstile is an open-source framework for generating high-quality synthetic function-calling training data from API specifications. Fine-tuning small language models with this data significantly improves their tool-use performance, closing the gap with much larger models.
本文介绍了InMyStyle,一个隐私优先的系统,它在小型语言模型(0.5B–7B)上使用LoRA适配器,无需显式提示即可将AI编辑过的文本重写为符合个人用户写作风格的文本。评估显示,不同模型规模下质量趋于平稳,表明紧凑型模型足以胜任此任务。
本文表明,知识蒸馏对小型语言模型中的偏见具有非对称影响:在无歧义任务上,它提升了上下文遵循能力,但在有歧义任务上却损害了拒答校准;并提出了PCCD,一种用于诊断聚合指标遗漏的逐项损害的协议。
一篇博客文章的公告,解释了 BarunLM(一个 35M 参数的语言模型)的设计,涵盖其架构、训练方案和数据集准备,重点介绍了相对于其他 sub-100M 模型的效率和性能提升。
本文系统研究了面向小规模语言模型智能体(70-500M参数)的强化学习不稳定性问题,识别出三种失效模式,并提出了稳健技术,包括合并并重新初始化适配器方法及安全机制;该方法实现了稳定收敛并提升了胜率。
本文提出了一种统一的语义建模框架,利用带有多适配器架构的微调小型语言模型,用于Linkedin的大规模职位理解,提升了性能并降低了运营复杂度。
MindForge 是一个自动化管道,将开源命令行程序转换为无源码的训练环境,供小型语言模型使用。在由 GLM-5.2 生成的轨迹上微调 Qwen3.6-27B,显著提升了其在软件工程基准测试中的表现,取得了与更大模型相当的结果。
本文研究了上下文注入微调是否能提升小型语言模型在孟加拉国法律问答中利用检索到法律的能力。使用0.8B、2B和4B规模的Qwen3.5模型,发现微调在较小规模上有帮助,但在4B规模上无显著增益,并减少了语言漂移。
CHS-SQL提出了一种基于置信度引导的启发式搜索模式链接过程,用于使用小语言模型进行Text-to-SQL,通过在模式选择中平衡精确率和召回率,取得了SOTA结果。
MIITA是一个内存诱导的推理时自适应框架,专为小语言模型的持续学习设计。它存储修正方向原型,并在推理时应用门控隐藏状态自适应,从而在不更新主干参数的情况下缓解灾难性遗忘。
本文系统性地研究了使用PPO对小型语言模型(7000万至5亿参数)进行强化学习时的失败模式,识别出静默LoRA参数冻结、数值溢出和灾难性策略崩溃等问题,并提出了一种鲁棒系统,采用合并并重新初始化适配器、float32精度和安全机制。该方法收敛稳定,且使用更少的数据即超越基线。
本文研究了微调小语言模型(0.6B-20B参数)以从自然语言描述生成语法正确的MiniZinc模型,提出了一种跨模型错误自举方法,实现了高达98%的执行准确率,但求解准确率仍然有限。