全部文章,按抓取时间从新到旧排列。
本文提出一个可扩展的框架,使用AI驱动的Product Research Agents桥接搜索与CRM工作流,以实现电子商务中的主动客户再参与,该框架在生产部署中得到评估,显示CTR和销售有所提升。
VAKE是一个两阶段强化学习框架,通过显式引导与隐式推理将大语言模型中的潜在参数知识外部化,在多个基准测试中均取得了优异性能。
FinRCA-Bench是一个基准测试,旨在评估金融AI系统的证据检索和推理能力,为评估和改进提供标准化方法。
论文发现,bitsandbytes INT4量化显著放大了LLMs中的前瞻干扰,在重复覆盖的上下文中降低了准确性,并突显了语义密集型应用中的部署风险。
本文提出在可解释推荐系统中将生成与选择分离,以降低服务成本,使用冻结的候选解释池和一个小型CPU常驻选择器。它对离线池选择器进行基准测试,发现成对学习排序在F1分数上优于单动作强化学习公式,如PPO、GRPO和DPO。
本文介绍了AFANet,一个用于多智能体系统中智能体故障归因的轻量级基于图的框架,它在性能上匹配或超越基于LLM的方法,同时计算成本显著降低。
本文介绍了HN-CLIP,一种利用文本编码器的文本-文本几何结构为密集描述检索创建自适应相似性边界的方法,解决了对比学习中的饱和问题,并在性能上超越现有方法。
本研究探讨了多语言大型语言模型如何在内部处理跨语言的主谓一致,发现模型为具有显性屈折变化的语言重用共享的计算结构,表明在形态句法处理中存在跨语言重叠。
UMER 引入了一个统一的多模态检索框架,通过配对感知判别推理结合嵌入与排序,在 MMEB-V2 基准测试中达到了最先进的性能。
DART-SD提出了一种拓扑感知的检索和调优框架,用于基于LLM的工具调用代理的自蒸馏,通过仅纠正关键拓扑断点并保留有效推理来提升策略多样性。
MissDiag 引入了一个诊断评估框架,该框架将 KGQA 和 KG-RAG 系统在不完全知识下的鲁棒性分解为类型化证据干预,以实现更可解释的比较。
本文介绍了SDDL,一个神经符号框架,通过将自然语言问题转化为形式化表示,提高了资源受限语言模型中的组合优化精度,与直接生成和求解器代码基线相比,实现了更高的可行性率。
WhiteMatter通过KV混合在Transformers中引入全对全跨层连接,在预训练实验中减少内存占用并提升性能,相比于标准架构。
OmniAlign 是一个统一的多语言对齐工具,它使用单个轻量级模型同时支持词级和句子级对齐,在基准测试中表现出色,并能良好地泛化到未见过的语言对。
本文介绍了Individual Conformal Coupling Monitor (ICCM),一种预推理方法,用于检测可穿戴压力分类中的结构模糊性,通过路由不确定信号以进行弃权或推迟来提高安全性。
本文提出了一种三流微调大语言模型框架,用于心理健康领域的自动化临床督导,实现了高精度的技术识别,并将督导分诊延迟从72小时降低到实时。
本文评估了当代码库受到语义保持转换干扰时,AI代码代理的鲁棒性,揭示了一个崎岖的前沿,其中模型性能在不同的框架和基准测试中不可预测地变化。
本文首次系统研究了已灭绝的西夏语的分词问题,结合传统词典、无标注文本和预训练字符编码器,尽管资源极端稀缺,仍实现了高性能。
本文介绍了THPT-Ladder,这是一个使用越南2025凸面评分方案评估AI模型的基准测试,揭示了部分分数差距如何导致与标准准确度指标相比的不准确评估。
本研究探讨了在大型语言模型上微调文化数据是否能提升比喻语言的理解能力,反之亦然。研究发现,虽然诗歌微调能增强成语理解,但文化微调可能会降低谚语准确率,突显了两者之间关系的非直接性。