我们发布了一个203M参数的葡萄牙语语言模型——真实本地CPU演示与公开权重

Reddit r/artificial 模型

摘要

WAR Enterprise发布了WARMIND-200M V2,一个203M参数的以葡萄牙语为先的因果语言模型,拥有公开权重并支持本地CPU推理,旨在作为验证其完整训练流程的研究检查点。

嗨,r/artificial,我们最近发布了WARMIND-200M V2,这是由巴西的WAR Enterprise开发的一个实验性的以葡萄牙语为先的因果语言模型。附带的视频展示了该模型在本地CPU上运行的情况。等待时间被缩短了,但提示词和输出内容没有改变。我们故意保留不完美的回复,因为这是一个研究检查点,而不是生产助手。主要规格: - 203,263,872个参数 - 约10亿个预训练token - 2370万个有监督SFT token - 20个Transformer层 - 分组查询注意力(Grouped-Query Attention) - SwiGLU、RMSNorm和RoPE - 1,024个token的操作上下文 - 本地CPU推理 - Apache 2.0许可证 此版本的主要目标是验证完整的流程:数据集准备、分词器训练、预训练、有监督微调、打包和本地推理。由于对于一个203M参数的模型来说,训练token预算相对较小,它仍然可能产生幻觉、重复信息、犯事实错误并生成不完整的回答。权重和完整文档已公开提供:https://huggingface.co/warenterprise/WARMIND-200M-V2 我们目前正在研究下一代,可能在5亿参数左右,训练语料库将大幅扩大,并集成外部工具。最终架构和发布时间表尚未确定。对于下一个版本,你会优先考虑什么:更好的数据质量、更多的训练token、更大的架构,还是更强的工具集成?
查看原文

相似文章

LLaDA2.X (GitHub 仓库)

TLDR AI

蚂蚁集团发布LLaDA2.X系列扩散语言模型,扩展至千亿参数,采用MoE架构,开源模型权重和训练代码。

WARP: 权重空间分析用于恢复训练数据组合

arXiv cs.LG

WARP是一种框架,通过模型合并生成伪检查点并提取几何特征,从已发布权重中恢复微调模型的域混合权重。它在BERT和GPT-2上实现了低平均绝对误差,优于成员推断。