标签
微信WeLM团队发表论文,介绍Hidden Decoding方法,在不增加Transformer主干参数的情况下通过隐藏流扩展计算,训练出WeLM-HD4-80B和WeLM-HD4-617B MoE模型,在多项基准上超越自回归基线。
Fenng shares a self-media comparison between the fourth-generation WeLM-80B (80B total params, 3B activated, 3.75% activation rate) and DeepSeek-V4-Flash (284B total, 13B activated, 4.6% activation rate), with a humorous comment.
Fenng 解释了腾讯 WeLM(闭源大模型)与混元(开源大模型)的定位区别,指出闭源模型不会公开技术细节或参与评测,建议从产品体验了解。
微信推出AI Agent产品「小微」,主模型使用WeLM,部分回答由DeepSeek兜底,已开始灰度测试。