全部文章,按抓取时间从新到旧排列。
本文介绍了对抗性评审(AR),一种用于智能代理代码评审的最小协作协议,它利用结构化分歧来提升仓库级编码任务的性能,在LiveCodeBench和SWE-bench等基准测试中,以更少的代理超越了基线方法。
本可解释性研究通过分析不确定性如何通过口头标记、弃权和数值分数表达,聚焦于Qwen3-4B,考察了大型语言模型中的过度自信现象,并提出了识别和缓解过度自信错误的方法。
StocksTalk是一个支持语音的对话代理,将口语自然语言映射为可执行的SQL查询,用于金融数据筛选,整合检索增强生成和人在环中验证以减少错误。
本文评估了大语言模型在罗马乌尔都语(一种资源匮乏语言)中的仇恨言论检测能力,证明使用LoRA的参数高效微调相比零样本推理显著提升了分类性能。
DeepTCM1.0是一个基于DeepSeek V3.2大语言模型构建的多专家智能体框架,用于解析中药复方的机制,通过Guizhi Decoction进行验证,并通过综合评分系统进行评估。
本文介绍了模式稳定性得分(PSS),一种用于机器生成文本鲁棒水印检测的新框架,在AUC上实现了10-15个百分点的提升,并能在不同的LLMs和改写器之间泛化。
FraudBench 是一个可执行基准测试,用于对基于政策的银行代理进行对抗自适应欺诈攻击的压力测试,模拟具有工具、可变状态和内部政策文档的场景。
BERTilda是一个可解释的框架,通过构建带有相似性和流信号的时间图来跟踪纵向文本流中的主题生命周期,以检测分裂、合并和其他转变,并在标注数据集上达到高一致率。
本文介绍了中东文化敏感度评分(MECSS),用于衡量大语言模型中的东方主义偏见,发现GPT-4和Falcon3-7B-Instruct系统地再现了这种结构性模式。
本文介绍了一种结合IEEE关键气体法与优化模糊逻辑的方法,用于利用溶解气体分析诊断电力变压器故障,在实验验证中实现了高达98.6%的准确率。
提出 Fractional Decay KV-Cache (FD-KVC),一种用于对话系统的所有权感知内存管理算法,该算法使用双通道评分来提升推理相关性,在复合指标上优于 H2O +6.7%,并能更快适应话题变化。
本文介绍了INCLUDE,一个多语言评估基准,用于量化LLMs中以印度为中心的社会文化偏见,揭示非英语印度语言比英语表现出更高的偏见,表明存在跨语言安全对齐差距。
本文介绍了FrenchNews-7,一个用于跨多个发布者分类法国新闻编辑部的基准,特点是一个微调的CamemBERT分类器以及与LLM基线的评估。
这篇立场论文认为,AI排行榜由于缺乏独立治理和利益冲突政策,结构性地不适合服务全球南方,并以印度为例,强调制度障碍并提出解决方案。
本文提出MAVEN,一个用于评估多模态内容宏观社会价值的分层框架,包含一个基准测试和优化评估器,以实现可扩展评估。
本文对Agentic AI进行了系统性综述,讨论了其历史演变、架构、应用、挑战和未来研究方向。
本文通过分析语言和视觉语言模型中的后门攻击,提出检测框架和新颖的攻击方法,并介绍针对临床应用的高效多模态模型,以解决人工智能中的安全性和效率问题。