全部文章,按抓取时间从新到旧排列。
本文评估了大语言模型在罗马乌尔都语(一种资源匮乏语言)中的仇恨言论检测能力,证明使用LoRA的参数高效微调相比零样本推理显著提升了分类性能。
DeepTCM1.0是一个基于DeepSeek V3.2大语言模型构建的多专家智能体框架,用于解析中药复方的机制,通过Guizhi Decoction进行验证,并通过综合评分系统进行评估。
本文介绍了模式稳定性得分(PSS),一种用于机器生成文本鲁棒水印检测的新框架,在AUC上实现了10-15个百分点的提升,并能在不同的LLMs和改写器之间泛化。
FraudBench 是一个可执行基准测试,用于对基于政策的银行代理进行对抗自适应欺诈攻击的压力测试,模拟具有工具、可变状态和内部政策文档的场景。
BERTilda是一个可解释的框架,通过构建带有相似性和流信号的时间图来跟踪纵向文本流中的主题生命周期,以检测分裂、合并和其他转变,并在标注数据集上达到高一致率。
本文介绍了中东文化敏感度评分(MECSS),用于衡量大语言模型中的东方主义偏见,发现GPT-4和Falcon3-7B-Instruct系统地再现了这种结构性模式。
本文介绍了一种结合IEEE关键气体法与优化模糊逻辑的方法,用于利用溶解气体分析诊断电力变压器故障,在实验验证中实现了高达98.6%的准确率。
提出 Fractional Decay KV-Cache (FD-KVC),一种用于对话系统的所有权感知内存管理算法,该算法使用双通道评分来提升推理相关性,在复合指标上优于 H2O +6.7%,并能更快适应话题变化。
本文介绍了INCLUDE,一个多语言评估基准,用于量化LLMs中以印度为中心的社会文化偏见,揭示非英语印度语言比英语表现出更高的偏见,表明存在跨语言安全对齐差距。
本文介绍了FrenchNews-7,一个用于跨多个发布者分类法国新闻编辑部的基准,特点是一个微调的CamemBERT分类器以及与LLM基线的评估。
这篇立场论文认为,AI排行榜由于缺乏独立治理和利益冲突政策,结构性地不适合服务全球南方,并以印度为例,强调制度障碍并提出解决方案。
本文提出MAVEN,一个用于评估多模态内容宏观社会价值的分层框架,包含一个基准测试和优化评估器,以实现可扩展评估。
本文对Agentic AI进行了系统性综述,讨论了其历史演变、架构、应用、挑战和未来研究方向。
本文通过分析语言和视觉语言模型中的后门攻击,提出检测框架和新颖的攻击方法,并介绍针对临床应用的高效多模态模型,以解决人工智能中的安全性和效率问题。
NE-BERT 是一个多语言编码器模型,在830万句数据上训练,覆盖九种东北印度语言和两种锚定语言,通过自定义分词技术,在超低资源语言上显著优于现有模型如 IndicBERT-V2 和 MuRIL。
FinSkillBench是一个针对投资管理领域AI代理的评估套件,表明精心策划的程序化技能相比自生成技能能提升性能。
本文介绍了AMRA,一种权重编辑方法,通过模糊拒绝信号来缓解大型语言模型中的Abliteration,在Llama-3-8B和Gemma-2-9B上提升消融后的拒绝分数,同时最小化效用下降。