最新

全部文章,按抓取时间从新到旧排列。

Cards List

成对排序在离线解释选择中优于单动作强化学习:一个实用教训

arXiv cs.AI · 10小时前 缓存

本文提出在可解释推荐系统中将生成与选择分离,以降低服务成本,使用冻结的候选解释池和一个小型CPU常驻选择器。它对离线池选择器进行基准测试,发现成对学习排序在F1分数上优于单动作强化学习公式,如PPO、GRPO和DPO。

0 人收藏 0 人点赞

超越基于LLM的推理:轻量级GNN用于智能体故障归因

arXiv cs.CL · 10小时前 缓存

本文介绍了AFANet,一个用于多智能体系统中智能体故障归因的轻量级基于图的框架,它在性能上匹配或超越基于LLM的方法,同时计算成本显著降低。

0 人收藏 0 人点赞

哪些负样本重要?问问你的文本编码器:密集描述检索的自适应相似性边界

arXiv cs.AI · 10小时前 缓存

本文介绍了HN-CLIP,一种利用文本编码器的文本-文本几何结构为密集描述检索创建自适应相似性边界的方法,解决了对比学习中的饱和问题,并在性能上超越现有方法。

0 人收藏 0 人点赞

共享电路与共享语法:跨语言的主谓一致追踪

arXiv cs.CL · 10小时前 缓存

本研究探讨了多语言大型语言模型如何在内部处理跨语言的主谓一致,发现模型为具有显性屈折变化的语言重用共享的计算结构,表明在形态句法处理中存在跨语言重叠。

0 人收藏 0 人点赞

UMER:通过配对感知判别推理统一嵌入与排序以实现通用多模态检索

arXiv cs.AI · 10小时前 缓存

UMER 引入了一个统一的多模态检索框架,通过配对感知判别推理结合嵌入与排序,在 MMEB-V2 基准测试中达到了最先进的性能。

0 人收藏 0 人点赞

DART-SD: 基于钻石拓扑感知的检索与调优框架,用于多轮工具调用代理的自蒸馏

arXiv cs.CL · 10小时前 缓存

DART-SD提出了一种拓扑感知的检索和调优框架,用于基于LLM的工具调用代理的自蒸馏,通过仅纠正关键拓扑断点并保留有效推理来提升策略多样性。

0 人收藏 0 人点赞

MissDiag:KGQA与KG-RAG中不完全知识鲁棒性的诊断评估

arXiv cs.CL · 10小时前 缓存

MissDiag 引入了一个诊断评估框架,该框架将 KGQA 和 KG-RAG 系统在不完全知识下的鲁棒性分解为类型化证据干预,以实现更可解释的比较。

0 人收藏 0 人点赞

通过形式化抽象改进资源受限语言模型中的自然语言组合优化精度

arXiv cs.AI · 10小时前 缓存

本文介绍了SDDL,一个神经符号框架,通过将自然语言问题转化为形式化表示,提高了资源受限语言模型中的组合优化精度,与直接生成和求解器代码基线相比,实现了更高的可行性率。

0 人收藏 0 人点赞

WhiteMatter: 通过KV混合实现全对全跨层连接

arXiv cs.CL · 10小时前 缓存

WhiteMatter通过KV混合在Transformers中引入全对全跨层连接,在预训练实验中减少内存占用并提升性能,相比于标准架构。

0 人收藏 0 人点赞

OmniAlign:一个统一的多语言词对齐与句对齐工具

arXiv cs.CL · 10小时前 缓存

OmniAlign 是一个统一的多语言对齐工具,它使用单个轻量级模型同时支持词级和句子级对齐,在基准测试中表现出色,并能良好地泛化到未见过的语言对。

0 人收藏 0 人点赞

当干净信号不足时:检测结构模糊性以确保可穿戴压力分类的安全性

arXiv cs.AI · 10小时前 缓存

本文介绍了Individual Conformal Coupling Monitor (ICCM),一种预推理方法,用于检测可穿戴压力分类中的结构模糊性,通过路由不确定信号以进行弃权或推迟来提高安全性。

0 人收藏 0 人点赞

心理健康领域的教育型人工智能:基于三流微调大语言模型的自动化临床督导与风险分诊框架

arXiv cs.CL · 10小时前 缓存

本文提出了一种三流微调大语言模型框架,用于心理健康领域的自动化临床督导,实现了高精度的技术识别,并将督导分诊延迟从72小时降低到实时。

0 人收藏 0 人点赞

崎岖前沿:评估代码代理对语义保持转换的鲁棒性

arXiv cs.AI · 10小时前 缓存

本文评估了当代码库受到语义保持转换干扰时,AI代码代理的鲁棒性,揭示了一个崎岖的前沿,其中模型性能在不同的框架和基准测试中不可预测地变化。

0 人收藏 0 人点赞

极端资源稀缺下的西夏文分词:整合传统词典与无标注文本

arXiv cs.CL · 10小时前 缓存

本文首次系统研究了已灭绝的西夏语的分词问题,结合传统词典、无标注文本和预训练字符编码器,尽管资源极端稀缺,仍实现了高性能。

0 人收藏 0 人点赞

测量部分分数差距:越南2025凸面评分方案的严格基准测试

arXiv cs.AI · 10小时前 缓存

本文介绍了THPT-Ladder,这是一个使用越南2025凸面评分方案评估AI模型的基准测试,揭示了部分分数差距如何导致与标准准确度指标相比的不准确评估。

0 人收藏 0 人点赞

大型语言模型中的比喻与文化知识:通过微调研究跨领域迁移

arXiv cs.CL · 10小时前 缓存

本研究探讨了在大型语言模型上微调文化数据是否能提升比喻语言的理解能力,反之亦然。研究发现,虽然诗歌微调能增强成语理解,但文化微调可能会降低谚语准确率,突显了两者之间关系的非直接性。

0 人收藏 0 人点赞

治理记录作为监督:验证器选择的自训练用于结构化工作流修复

arXiv cs.AI · 10小时前 缓存

本文研究了利用机器可验证工作流的治理记录作为监督信号,训练语言模型执行结构化工作流修复,证明验证器选择的自训练能提升执行效率和有效性。

0 人收藏 0 人点赞

面向自主科学代理的以工件为中心的主张感知可观测性

arXiv cs.CL · 10小时前 缓存

本文提出了一种针对自主科学代理的主张感知可观测性框架,强调工件沿袭和审计关系,以提高科学工作流程的透明度和错误检测能力。

0 人收藏 0 人点赞

利用 PyTorch 原生栈在服务器 CPU 上高效进行小型 NLP 模型的 INT8 推理

arXiv cs.CL · 10小时前 缓存

本文将 SmoothQuant 集成到 PyTorch 的原生栈中,以在 Intel Xeon CPU 上高效进行小型 NLP 模型的 INT8 推理,实现了高达 5.8 倍的加速,且精度损失可忽略不计。

0 人收藏 0 人点赞

ComponentBench: 诊断计算机使用代理中的组件级故障

arXiv cs.AI · 10小时前 缓存

ComponentBench 引入了一个基准和诊断管道,用于评估计算机使用代理在现代网页用户界面中的组件级交互,通过关注现实、短暂的交互来诊断跨模型的故障,从而填补当前评估方法的空白。

0 人收藏 0 人点赞
← 上一页
下一页 →
← 返回首页

提交意见反馈