训练了我的第一个小型语言模型

Reddit r/LocalLLaMA 模型

摘要

作者训练了一个小型语言模型来替代Gemini Flash进行摘要任务,达到了97%的准确率和0.06秒的延迟,适合在内部应用中部署。

我有一个工具,它使用Gemini Flash的最低思考预算来进行摘要工作。它非常快,大多数情况下在0.9到1.2秒之间。但我在用户体验上遇到了问题,当使用团队内部应用时,人们会做出错误的选择。Gemini Flash可以弄清楚用户应该做什么并突出显示正确的下一步,但人们操作太快,导致0.9秒的时间不够用。我知道,0.9秒看起来不算太长,但如果你每天使用应用一千次,你会非常快速地点击、点击、点击,不会多想。提示类似于“对于‘字符串a’和‘字符串b’,字符串b是否以某种方式与字符串a相关?”答案是布尔值。确定性的Python和JavaScript可以在几毫秒内回答这个问题,并且准确率略高于66%。Gemini Flash的准确率是99%。我起初犹豫是否要训练新模型,以为会很难。我只是遵循了一个商业AI工具建议的说明。我大约有550个示例用例。然后我使用了两个不同的前沿模型来创建相似的示例,总共大约有2,500个。训练是在我的RTX A6000 16GB GPU上完成的,大约花了15分钟。最终结果是一个小型模型,大约50MB。当我在本地运行时,它建议正确答案的概率是97%,在CPU(较旧的Threadripper,3.1GHz)上运行时响应时间为0.06秒。在这种情况下,99%和97%的准确率差异完全可以接受。我将部署这个模型在服务器端运行,这会增加一点点延迟,服务器可能比我的工作站稍慢。我还在记录准确率和比较结果,以便评估它并补充训练。理论上,我可以在浏览器中进行客户端处理。我计划在周末部署,但我预计0.1到0.2秒的延迟足够快,不需要客户端推理的复杂性,但这听起来很有趣。
查看原文

相似文章

适合 <2000 token 的轻量级摘要小模型

Reddit r/LocalLLaMA

一位新手在尝试用 Qwen2.5-7B-Instruct 给员工笔记做摘要时遭遇幻觉,现求助适用于 2000 token 以内、能合并同类标签的小模型及提示策略。

@TheZvi: 这看起来超级酷,祝贺大家。

X AI KOLs Timeline

AVERI 与 Google DeepMind、OpenMined 和 MLCommons 合作,宣布了针对专有语言模型 Gemini 2.5 Flash-Lite 的首次双盲评估,标志着在AI模型评估中的历史性里程碑。

小型语言模型的训练与无限API推理

Reddit r/artificial

一个团队开发了一个平台,允许用户微调和部署小型语言模型,并提供无限API推理,利用他们自己的GPU进行高效训练和推理。

微语言模型实现即时响应

Hugging Face Daily Papers

研究人员推出 8M–30M 参数的微型语言模型,可在本地设备瞬间生成前几个词,再由云端模型补全,让智能手表等超受限设备也能拥有响应迅速的 AI 体验。