小型语言模型的训练与无限API推理

Reddit r/artificial 产品

摘要

一个团队开发了一个平台,允许用户微调和部署小型语言模型,并提供无限API推理,利用他们自己的GPU进行高效训练和推理。

长期以来,我感觉对于大多数任务,生成式AI模型实际上并不需要前沿模型提供的过度庞大的能力。此外,通过API访问时,它们往往费用高昂。一个拥有4-14亿参数、多模态能力,并配备正确工具、数据和知识的开源模型,对于大多数用例来说已经足够。基于这个想法,我决定与团队一起构建一个简单的平台,让用户能够快速且无需编码地微调和部署这些轻量级模型。经过多次迭代,我们成功开发了我们认为是最佳的框架,任何人都可以通过微调或RAG来部署和定制一个小型的4B或9B模型。最重要的是,您可以下载权重,在本地运行,并拥有模型的知识产权和所有权,不像许多情况下大供应商会将您锁定。我们还与当地数据中心达成协议,现在拥有自己的GPU。这意味着训练和推理不仅速度极快,我们还能提供无限推理。如果您需要一个定制化、经济实惠且具有无限API推理的模型,我认为这可能对您非常有用。有一个免费层,如果您试用并给我们一些反馈,我会免费为您提供6个月的订阅计划。由于我们在数据中心有自己的GPU,我们的基础设施成本是固定的。我对结果非常满意,并且我在自己的许多项目中使用这些模型。您可以访问平台 neuro-block.com。期待在评论中听到您的想法。
查看原文

相似文章

利用适度非结构化稀疏权重矩阵加速大语言模型的GPU推理

arXiv cs.LG

本文提出了一种针对具有适度非结构化稀疏性的大语言模型的高效GPU推理方法。引入了一种三层矩阵存储格式和一个联合利用稀疏张量核心与CUDA核心的SpMM内核,实现了相比SpInfer最高1.64倍的内核级加速,以及相比FlashLLM最高1.41倍的端到端加速。