标签
本文提出了一种精确的生成-变换分解方法,用以分析小型7–9B LLM团队在八种编排架构下的扩展性表现。研究发现,扩展收益与任务高度相关:Proposer-Critic 架构在算术基准测试中表现最佳,但没有任何一种架构能在所有任务中全面占优。
作者通过分析高温度下的对数概率和校准,探索使用如Gemma 4等小型语言模型作为分类器,并在GitHub上分享代码与发现。
提出FiT,一个诊断框架,用于在微调前评估小型LLM在网络安全问答方面的能力,表明根据不同的微调模式,微调可能会降低词汇和参数化知识。提供避免不必要微调的指导。
使用QLoRA对小型LLM(3B-7B)进行生物医学声明验证的微调,以44.5倍更低的成本实现了比GPT-4o和GPT-5更高的F1分数,并揭示了SciFact中的一个结构伪影。该研究表明,在结构合理的数据上进行训练可实现稳健的跨域迁移。
对20个为6GB GPU量化的小LLM的详细基准测试,测量了不同上下文长度下的速度和VRAM使用情况,并对工具使用和指令遵循进行了定性探针。该报告旨在帮助拥有中等硬件的用户为本地私有的自动化任务选择模型。