全部文章,按抓取时间从新到旧排列。
MissDiag 引入了一个诊断评估框架,该框架将 KGQA 和 KG-RAG 系统在不完全知识下的鲁棒性分解为类型化证据干预,以实现更可解释的比较。
本文介绍了SDDL,一个神经符号框架,通过将自然语言问题转化为形式化表示,提高了资源受限语言模型中的组合优化精度,与直接生成和求解器代码基线相比,实现了更高的可行性率。
WhiteMatter通过KV混合在Transformers中引入全对全跨层连接,在预训练实验中减少内存占用并提升性能,相比于标准架构。
OmniAlign 是一个统一的多语言对齐工具,它使用单个轻量级模型同时支持词级和句子级对齐,在基准测试中表现出色,并能良好地泛化到未见过的语言对。
本文介绍了Individual Conformal Coupling Monitor (ICCM),一种预推理方法,用于检测可穿戴压力分类中的结构模糊性,通过路由不确定信号以进行弃权或推迟来提高安全性。
本文提出了一种三流微调大语言模型框架,用于心理健康领域的自动化临床督导,实现了高精度的技术识别,并将督导分诊延迟从72小时降低到实时。
本文评估了当代码库受到语义保持转换干扰时,AI代码代理的鲁棒性,揭示了一个崎岖的前沿,其中模型性能在不同的框架和基准测试中不可预测地变化。
本文首次系统研究了已灭绝的西夏语的分词问题,结合传统词典、无标注文本和预训练字符编码器,尽管资源极端稀缺,仍实现了高性能。
本文介绍了THPT-Ladder,这是一个使用越南2025凸面评分方案评估AI模型的基准测试,揭示了部分分数差距如何导致与标准准确度指标相比的不准确评估。
本研究探讨了在大型语言模型上微调文化数据是否能提升比喻语言的理解能力,反之亦然。研究发现,虽然诗歌微调能增强成语理解,但文化微调可能会降低谚语准确率,突显了两者之间关系的非直接性。
本文研究了利用机器可验证工作流的治理记录作为监督信号,训练语言模型执行结构化工作流修复,证明验证器选择的自训练能提升执行效率和有效性。
本文将 SmoothQuant 集成到 PyTorch 的原生栈中,以在 Intel Xeon CPU 上高效进行小型 NLP 模型的 INT8 推理,实现了高达 5.8 倍的加速,且精度损失可忽略不计。
ComponentBench 引入了一个基准和诊断管道,用于评估计算机使用代理在现代网页用户界面中的组件级交互,通过关注现实、短暂的交互来诊断跨模型的故障,从而填补当前评估方法的空白。
本文通过研究表情符号增强的提示,探讨了大语言模型在文本输入之外的安全性,揭示了当前安全评估的漏洞和模型依赖性漏洞。
SESSE是一个无需训练的框架,将整体性的LLM-as-Judge评估分解为结构化子问题,从而提高可解释性并诊断标签模糊性,同时与微调模型达到竞争性的性能。
本研究评估了 LLMs 在电子商务任务中作为数据质量标注器的表现,发现当需要背景知识时,它们优于基线方法,但对于具有强烈词汇信号的任务优势有限,同时展示了跨运行的高度一致性。
本文提出了一个在Netflix使用大语言模型作为评判者来评估推荐解释的生命周期框架,涵盖从开发到部署和监控的各个阶段,并通过A/B测试取得了积极结果,显示用户参与度得到提升。
本文对开源OCR、LLM和VLM系统在高风险公共部门应用中的结构化信息提取进行了基准测试,发现VLM通常优于OCR+LLM流水线,但大多数配置在零样本设置中表现不佳,强调了输入质量的关键作用。
研究考察了大型语言模型对道义情态词的使用情况,发现与人类相比,模型较少使用'must'和'should'等术语,这反映了其训练基于正式书面语料库。