小型语言模型的训练与无限API推理
摘要
一个团队开发了一个平台,允许用户微调和部署小型语言模型,并提供无限API推理,利用他们自己的GPU进行高效训练和推理。
长期以来,我感觉对于大多数任务,生成式AI模型实际上并不需要前沿模型提供的过度庞大的能力。此外,通过API访问时,它们往往费用高昂。一个拥有4-14亿参数、多模态能力,并配备正确工具、数据和知识的开源模型,对于大多数用例来说已经足够。基于这个想法,我决定与团队一起构建一个简单的平台,让用户能够快速且无需编码地微调和部署这些轻量级模型。经过多次迭代,我们成功开发了我们认为是最佳的框架,任何人都可以通过微调或RAG来部署和定制一个小型的4B或9B模型。最重要的是,您可以下载权重,在本地运行,并拥有模型的知识产权和所有权,不像许多情况下大供应商会将您锁定。我们还与当地数据中心达成协议,现在拥有自己的GPU。这意味着训练和推理不仅速度极快,我们还能提供无限推理。如果您需要一个定制化、经济实惠且具有无限API推理的模型,我认为这可能对您非常有用。有一个免费层,如果您试用并给我们一些反馈,我会免费为您提供6个月的订阅计划。由于我们在数据中心有自己的GPU,我们的基础设施成本是固定的。我对结果非常满意,并且我在自己的许多项目中使用这些模型。您可以访问平台 neuro-block.com。期待在评论中听到您的想法。
相似文章
大型语言模型在某些营销任务中过于庞大。小语言模型登场。
ZeroGPU推出了针对广告技术任务的专用小语言模型(SLM),与大型语言模型相比,成本更低、性能更快。这些小语言模型在CPU上运行,已帮助早期采用者Dappier将费用降低了50%。
通过小型语言模型实现AI民主化:面向本地部署的结构化基准测试与参数高效微调
本文在结构化基准上评估了九个开放权重的小型语言模型(参数量135M至3B),并证明参数高效微调显著提升了准确率,使其在结构化小众工作负载的本地部署中具备可行性。
@_avichawla: https://x.com/_avichawla/status/2077653695123378321
本文认为,vLLM及类似的服务框架由于设计限制,在单个GPU上运行多个小型AI模型时效率低下。它介绍了SIE开源推理引擎,作为同时服务多个模型以降低成本的一种解决方案。
据报道,OpenAI找到了将推理成本减半的方法
据报道,OpenAI开发了一种将AI推理成本减半的方法,这可能对部署大型语言模型的经济性产生重大影响。
利用适度非结构化稀疏权重矩阵加速大语言模型的GPU推理
本文提出了一种针对具有适度非结构化稀疏性的大语言模型的高效GPU推理方法。引入了一种三层矩阵存储格式和一个联合利用稀疏张量核心与CUDA核心的SpMM内核,实现了相比SpInfer最高1.64倍的内核级加速,以及相比FlashLLM最高1.41倍的端到端加速。