标签
本文比较了用于评估危机热线通话记录中自杀风险的阿拉伯语和英语大型语言模型,表明两者都能在保持音频本地处理以保护隐私的同时,有效识别高风险案例。
这项比较研究评估了基于编码器和解码器的大语言模型在自动语音识别(ASR)评估中的应用,发现编码器指标如BERTScore和SemDist具有很强的竞争力,而生成式模型增强了假设比较和可解释性。
本文介绍了针对罗马乌尔都语仇恨言论分类的参数高效微调与提示工程技术的比较研究。
对BART、BERT和RoBERTa在文本摘要中的比较研究,探讨它们的架构以及在抽取式和生成式摘要任务中的适用性。
本文评估了大语言模型在罗马乌尔都语(一种资源匮乏语言)中的仇恨言论检测能力,证明使用LoRA的参数高效微调相比零样本推理显著提升了分类性能。
本文比较了六种用于电价预测的深度学习模型,建立了一个标准化的基准框架,以实现跨市场的一致评估,尤其是在数据不足的场景下。
本文比较了微调后的MahaBERT模型与大型语言模型(Gemini、LLaMA-3.3-70B、Gemma)在马拉地语命名实体识别上的表现,发现专门的BERT模型显著优于这些大型语言模型,其F1分数为0.88–0.91,而后者仅为0.57–0.69。
本文评估了十二种最新文本编码器在三种心理学情绪理论中编码情感线索的能力,发现指令感知的开源权重编码器在单词级别上达到或超过专有编码器,而任务微调嵌入在句子级别上更优。
本文对贝叶斯上下文赌博机(BCB)、XGBoost和线性回归在电商仓库实时分拣转向优化中进行了比较研究,结果显示BCB实现了2.03%的奖励提升,并具有优越的在线学习和推理延迟性能。
这项研究比较了AI编码智能体(如Claude-Code和Codex)与人类专家程序员在长期任务上的表现,结果表明由于持续学习,人类的表现呈超线性增长,而智能体则趋于平稳,这突显了当前AI在扩展问题解决方面的关键局限性。
本文比较了19种图神经网络层类型在驾驶轨迹预测中的交互建模能力,发现ARMA、Chebyshev和拓扑感知层最为有效,并提出了改进预测模型的设计原则。
本文比较了深度学习向量嵌入(CamemBERT)和词汇共现图模型在法语“大国民辩论”语料库上引发的几何结构,发现局部拓扑相似但全局组织截然不同,凸显了两种方法的互补性。
本文评估了传统机器学习技术(随机森林、XGBoost、支持向量机)与深度学习模型(统一多任务时间序列模型)在零售客户流失预测中的表现,发现传统方法在预测性能和效率上可以更胜一筹。
本文对图增强检索(Graph-RAG)与标准纯向量RAG在跨实体金融情绪分析中的表现进行了比较研究,发现图增强检索在实体召回率和答案相关性方面有统计显著的提升,而延迟成本增加不大。
本文系统性地比较了在BERTopic流程中使用七种基于Transformer的语言模型时模型大小对主题质量的影响,发现模型大小对主题连贯性影响微乎其微,表明较小的模型可以达到与较大模型相当的性能。
本文对各种联邦学习聚合策略进行了全面的实验比较,分析了它们在homogeneous和heterogeneous数据分布下的性能和效率。