我们发布了一个203M参数的葡萄牙语语言模型——真实本地CPU演示与公开权重
摘要
WAR Enterprise发布了WARMIND-200M V2,一个203M参数的以葡萄牙语为先的因果语言模型,拥有公开权重并支持本地CPU推理,旨在作为验证其完整训练流程的研究检查点。
嗨,r/artificial,我们最近发布了WARMIND-200M V2,这是由巴西的WAR Enterprise开发的一个实验性的以葡萄牙语为先的因果语言模型。附带的视频展示了该模型在本地CPU上运行的情况。等待时间被缩短了,但提示词和输出内容没有改变。我们故意保留不完美的回复,因为这是一个研究检查点,而不是生产助手。主要规格:
- 203,263,872个参数
- 约10亿个预训练token
- 2370万个有监督SFT token
- 20个Transformer层
- 分组查询注意力(Grouped-Query Attention)
- SwiGLU、RMSNorm和RoPE
- 1,024个token的操作上下文
- 本地CPU推理
- Apache 2.0许可证
此版本的主要目标是验证完整的流程:数据集准备、分词器训练、预训练、有监督微调、打包和本地推理。由于对于一个203M参数的模型来说,训练token预算相对较小,它仍然可能产生幻觉、重复信息、犯事实错误并生成不完整的回答。权重和完整文档已公开提供:https://huggingface.co/warenterprise/WARMIND-200M-V2
我们目前正在研究下一代,可能在5亿参数左右,训练语料库将大幅扩大,并集成外部工具。最终架构和发布时间表尚未确定。对于下一个版本,你会优先考虑什么:更好的数据质量、更多的训练token、更大的架构,还是更强的工具集成?
相似文章
葡萄牙刚刚发布了他们自己的大语言模型 Amalia(9B)!
葡萄牙发布了 Amalia,一个拥有 90 亿参数的大语言模型。
LLaDA2.X (GitHub 仓库)
蚂蚁集团发布LLaDA2.X系列扩散语言模型,扩展至千亿参数,采用MoE架构,开源模型权重和训练代码。
@LiorOnAI: Thinking Machines 新模型:- 完整权重可用 - 原生文本、图像和音频推理 - 总参数975B…
Thinking Machines 发布 Inkling,一种 MoE 模型,总参数975B/活跃41B,支持原生文本、图像和音频推理,上下文窗口达100万 token,完整权重可用。
WARP: 权重空间分析用于恢复训练数据组合
WARP是一种框架,通过模型合并生成伪检查点并提取几何特征,从已发布权重中恢复微调模型的域混合权重。它在BERT和GPT-2上实现了低平均绝对误差,优于成员推断。
@NousResearch: Ling-3.0-flash,来自@AntLingAGI的新MoE模型,现已在Nous Portal上免费提供一周!拥有124B参数……
AntLingAGI发布Ling-3.0-flash,这是一款124B参数的MoE模型,其中5.1B参数为活跃参数,现已在Nous Portal上免费提供一周。它在许多基准测试中匹配甚至超越其1T旗舰模型,专为编码和工具使用等智能体工作负载而设计。