wikitext

标签

Cards List
#wikitext

我预训练了一个700M参数的模型,在180亿个token上优化了Python和Wikitext | TheOneWhoWill/Shibai-700M-Base · Hugging Face

Reddit r/LocalLLaMA · 3天前 缓存

Shibai-700M-Base是一个基于LLaMA的700M参数模型,在180亿个token的英文、数学和Python代码上进行了预训练。尽管与更大模型相比训练不足,但仍能生成连贯的文本,并且因其在单个RTX 5070 Ti GPU上的高效训练而备受瞩目。

0 人收藏 0 人点赞
#wikitext

Chiaroscuro Attention:在黑暗中运用计算

Hugging Face Daily Papers · 2026-06-06 缓存

CHIAR-Former使用基于谱熵的路由,动态选择DCT、RBF和自注意力算子,在大规模文本数据集上实现了效率提升,同时通过混合注意力机制保持性能。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈