标签
This paper compares fine-tuned MahaBERT-based models with large language models (Gemini, LLaMA-3.3-70B, Gemma) for Marathi named entity recognition, finding that the specialized BERT models significantly outperform the LLMs, achieving F1-scores of 0.88–0.91 versus 0.57–0.69.
本文评估了十二种最新文本编码器在三种心理学情绪理论中编码情感线索的能力,发现指令感知的开源权重编码器在单词级别上达到或超过专有编码器,而任务微调嵌入在句子级别上更优。
本文对贝叶斯上下文赌博机(BCB)、XGBoost和线性回归在电商仓库实时分拣转向优化中进行了比较研究,结果显示BCB实现了2.03%的奖励提升,并具有优越的在线学习和推理延迟性能。
这项研究比较了AI编码智能体(如Claude-Code和Codex)与人类专家程序员在长期任务上的表现,结果表明由于持续学习,人类的表现呈超线性增长,而智能体则趋于平稳,这突显了当前AI在扩展问题解决方面的关键局限性。
本文比较了19种图神经网络层类型在驾驶轨迹预测中的交互建模能力,发现ARMA、Chebyshev和拓扑感知层最为有效,并提出了改进预测模型的设计原则。
本文比较了深度学习向量嵌入(CamemBERT)和词汇共现图模型在法语“大国民辩论”语料库上引发的几何结构,发现局部拓扑相似但全局组织截然不同,凸显了两种方法的互补性。
本文评估了传统机器学习技术(随机森林、XGBoost、支持向量机)与深度学习模型(统一多任务时间序列模型)在零售客户流失预测中的表现,发现传统方法在预测性能和效率上可以更胜一筹。
本文对图增强检索(Graph-RAG)与标准纯向量RAG在跨实体金融情绪分析中的表现进行了比较研究,发现图增强检索在实体召回率和答案相关性方面有统计显著的提升,而延迟成本增加不大。
本文系统性地比较了在BERTopic流程中使用七种基于Transformer的语言模型时模型大小对主题质量的影响,发现模型大小对主题连贯性影响微乎其微,表明较小的模型可以达到与较大模型相当的性能。
本文对各种联邦学习聚合策略进行了全面的实验比较,分析了它们在homogeneous和heterogeneous数据分布下的性能和效率。