标签
本文研究了领域偏移下金融命名实体识别的置信度估计和选择性预测,评估了BERT和LoRA微调的Qwen模型,以提高在不同输入分布(如SEC文件和社交媒体)下的可靠性。
对BART、BERT和RoBERTa在文本摘要中的比较研究,探讨它们的架构以及在抽取式和生成式摘要任务中的适用性。
本文评估了基于BERT的问答模型(RoBERTa、ALBERT、DistilBERT)在蒙特卡洛Dropout和输入改写条件下的可靠性,发现RoBERTa更为一致,并验证了MCD作为可靠性指标的有效性。
Presents STCAD, a scalable framework using BERT-based encoding and CURE clustering to perform trajectory clustering and anomaly detection on terabyte-scale AIS maritime data, demonstrating stable clusters and clear separation of anomalous vessel behavior.
本文介绍了一个用于检测立法委员会证词中自我介绍的机器学习流程,使用词袋和BERT概率等特征。XGBoost取得了最佳F1分数0.9747,并通过BERT增强特征进一步改进。
本文提出CNM,一种轻量级增强方法,通过表意描述序列将汉字的离散组合结构注入BERT,在提升稀有字符和未登录字符性能的同时保持通用自然语言理解准确率。
本文提出联合仿射谱整形(JRI),将仅权重的谱优化器(如Muon)扩展到仿射层中联合更新权重和偏置,在BERT-mini IMDb分类任务上显示出小而一致的准确率提升。
一条推文认为掩码语言建模没有必要,自回归模型就足够了,并顺便提到了 BERT。
本文提出了一种基于BERT的Mpox研究文章自动化多标签分类系统,准确率达到97%,并采用SHAP进行可解释性分析。该系统旨在帮助研究人员和医疗工作者快速找到相关信息。
本文比较了微调后的MahaBERT模型与大型语言模型(Gemini、LLaMA-3.3-70B、Gemma)在马拉地语命名实体识别上的表现,发现专门的BERT模型显著优于这些大型语言模型,其F1分数为0.88–0.91,而后者仅为0.57–0.69。
MyAwesomeModel,一个基于 BERT 的特征提取器,将句子转换为稠密向量,用于语义搜索、聚类和 NLP 流水线。
本文提出了一种跨语言数据增强策略,利用机器翻译将专家标注的难度标签从高资源语言迁移到低资源语言。基于BERT的回归模型实验表明,用翻译语料库增强稀缺的本土数据显著提高了文本难度评估的准确性。
本文介绍了使用贝叶斯数据混合和经验X风险最小化检测AI生成文本的方法,通过ModernBERT-large和MCGrad分类器在OOD检测上取得了高性能。
本文探讨了基于翻译的微调作为低资源语言本地语言BERT模型的资源高效替代方案的可行性,发现在六项NLP任务中,53.3%的情况下其性能相当或更优。
本文提出了一种Procrustes条件的联合端到端Top-K稀疏自编码器,用于从独立训练的BERT模型中提取通用特征,在跨种子特征对齐方面优于事后对齐方法。
@goyalayus 的一条推文指出,四本未指定的书籍足以学习任何领域,随后引用 Praveen Kumar Verma 的建议,按特定顺序阅读基础 LLM 论文,包括《Attention Is All You Need》、BERT、GPT、GPT-2、Scaling Laws 和 GPT-3。
BamiBERT 是一种新的基于BERT的越南语预训练语言模型,它解决了PhoBERT的局限性,支持更长的上下文,无需分词即可运行,并在多个越南语基准上取得了最先进的结果。
推荐一个解释Transformer架构的教育资源,涵盖token嵌入、自注意力、残差连接,以及与GPT和BERT的联系。