全部文章,按抓取时间从新到旧排列。
本文提出H2EDL,一种用于层次分类的超证据深度学习模型,它能捕捉标签层次结构中多层次的不确定性,减少校准误差,并在细粒度识别任务中提高粗粒度类别的保留率。
本文提出HB-SJD,一种用于视觉策略内蒸馏的批处理推测性雅可比解码方法。该方法通过并行处理多个词元来加速展开生成,在保持生成质量的同时缩短训练时间。
本文提出一种针对企业AI智能体的可逆遗忘方法来管理过时知识,引入一个框架,该框架包含记忆状态和控制器,根据相关性抑制和重新激活知识。
本文提出了一种用于省略三段论补全两两逻辑选择的神经符号管道,引入了PWAL方法,该方法使用逻辑阻力分数来提高准确性并在各种推理任务中减少平局。
本文提出了EvalCEGAR方法,该方法利用一组Python运算符池自动进化评估指标,能标记AI输出中的特定缺陷,相比手写运算符和LLM评判者提高了准确性。
本文提出了一种基于CrewAI构建的多代理框架,用于自动化对话式商业智能。该框架使用五个专门的AI代理来处理查询、检索数据并生成洞察。评估显示,在准确性和质量上较基线有显著提升。
本文提出一个诊断框架,用于评估LLM-judge能否在无参考验证器的情况下有效评估优化任务中的候选技能,重点在于能力和可区分性指标。
论文提出了反序回合策略优化(RTPO)来稳定多轮智能体强化学习训练,通过将展开组织为反序树并按反序执行回合级更新,展示了相较于基线的改进。
本文介绍了Sanyu Studio,一个多智能体对话系统,使用LLM为Sanyu油画构建艺术史叙事,展示了AI如何通过用户交互支持多样化的解释。
本文介绍了BFTR,一个电信资费推荐算法框架,优先考虑客户预算并防止超额收费。在受尼日利亚MTN市场启发的实验数据集上进行的实验证明了该框架的有效性,实现零附加费和高实用度。
MemFuse推出了MemFuseBench,一个用于评估AI智能体中多源记忆融合的基准测试,并提出了MemFuse——一种结构化的记忆系统,可在整合碎片化观察的同时保持来源的可追溯性。
CTIFoundry引入了一个代理原生的网络威胁情报语料框架,通过结构化本体图和程序性技能提升LLM代理的性能,在调查中实现更高的准确性和效率。
本文介绍了 Aslema,这是一个针对 NADI 2026 共享任务(口语语言理解)的系统,通过微调音频大语言模型和合成数据增强来提升突尼斯阿拉伯语方言的意图识别和槽位填充性能。
本文介绍了一种故障感知的对抗检索增强框架,利用上下文强盗来提升自然语言理解的鲁棒性,并在SNLI、ANLI和MultiNLI等基准测试中取得了显著改进。
本研究介绍了BudgetDoc,第一个用于评估文档任务中模型-预算-性能权衡的多模态基准,并开发了DRB,一种轻量级估计器,用于预测推理性能以优化计算分配并降低LLMs成本。
X2Streaming-TTS 提出了一种因果令牌级文本转语音框架,用于真正的流式合成,使用因果承诺和语音状态继承来处理不确定的文本前缀,并在低延迟口语对话系统中保持声学连续性。
本文介绍了TranslatePsy-AfriSLM,这是一个针对19种撒哈拉以南非洲语言的开源机器翻译资源集合,表明通过过滤合成数据微调的小型语言模型在性能上超越了如TranslateGemma-27B和Qwen3.5-122B-A10B等更大规模的模型。