标签
本文介绍了功能感知掩码,这是一种用于抗体语言模型的预训练算法,它将掩码放置与功能先验对齐,显著提升了结构和CDR相关任务的表现。
介绍AraSSM,一种通过阿拉伯语语料库上的掩码语言建模进行预训练的双向Mamba状态空间编码器,在消费级GPU上从头训练,同时在阿拉伯语自然语言理解基准上取得了有竞争力的结果。
一条推文认为掩码语言建模没有必要,自回归模型就足够了,并顺便提到了 BERT。
本文分析了为什么确定性JEPA风格的潜在预测适用于图像但不适用于文本,将失败归因于语言中的高条件方差,其中被屏蔽的上下文允许多个有效补全,而这些补全的表征缺乏一致的质心。
本文探讨了ModernBERT模型在法律领域的领域适应,通过在美国法院意见上进行进一步预训练,取得了相对于基础模型的显著改进,并公开发布了检查点。
本文提出了一种混合预训练目标,结合了JEPA潜在空间预测和MLM重建,用于语言模型,显示出改进的嵌入均匀性和语义-词汇平衡。
LDARNet 是一个拥有1.2亿参数的层次化基因组基础模型,引入了可学习的自适应分词机制(灵感来源于 H-Net 的动态分块),用于DNA序列的掩码语言建模。该模型在5项组蛋白修饰任务上取得了最先进的结果,并在多项基因组基准测试中超越了参数量多达其20倍的模型。其学习到的分词边界与启动子motif和剪接位点等生物学特征高度吻合。
对BERT base uncased模型的描述,这是一个在英文文本上使用掩码语言模型和下一句预测进行预训练的语言模型,可在Hugging Face上获取。