标签
Shibai-700M-Base是一个基于LLaMA的700M参数模型,在180亿个token的英文、数学和Python代码上进行了预训练。尽管与更大模型相比训练不足,但仍能生成连贯的文本,并且因其在单个RTX 5070 Ti GPU上的高效训练而备受瞩目。
CHIAR-Former使用基于谱熵的路由,动态选择DCT、RBF和自注意力算子,在大规模文本数据集上实现了效率提升,同时通过混合注意力机制保持性能。