最新

全部文章,按抓取时间从新到旧排列。

Cards List

对抗性评审(Adversarial Review):基于结构化分歧的实证智能代理代码评审

arXiv cs.AI · 6小时前 缓存

本文介绍了对抗性评审(AR),一种用于智能代理代码评审的最小协作协议,它利用结构化分歧来提升仓库级编码任务的性能,在LiveCodeBench和SWE-bench等基准测试中,以更少的代理超越了基线方法。

0 人收藏 0 人点赞

口头过度自信的多维度:一项可解释性研究

arXiv cs.CL · 6小时前 缓存

本可解释性研究通过分析不确定性如何通过口头标记、弃权和数值分数表达,聚焦于Qwen3-4B,考察了大型语言模型中的过度自信现象,并提出了识别和缓解过度自信错误的方法。

0 人收藏 0 人点赞

RDFdL:将RDF与微分动态逻辑集成

arXiv cs.AI · 6小时前 缓存

本文介绍了RDFdL,一个将RDF与微分动态逻辑集成的框架,以实现对信息物理系统中静态知识和动态行为的推理。

0 人收藏 0 人点赞

StocksTalk:一个支持语音的对话代理,用于网络数据的结构化查询生成

arXiv cs.CL · 6小时前 缓存

StocksTalk是一个支持语音的对话代理,将口语自然语言映射为可执行的SQL查询,用于金融数据筛选,整合检索增强生成和人在环中验证以减少错误。

0 人收藏 0 人点赞

针对资源匮乏语言仇恨言论检测的LLM高效适应:罗马乌尔都语的比较研究

arXiv cs.AI · 6小时前 缓存

本文评估了大语言模型在罗马乌尔都语(一种资源匮乏语言)中的仇恨言论检测能力,证明使用LoRA的参数高效微调相比零样本推理显著提升了分类性能。

0 人收藏 0 人点赞

DeepTCM1.0:基于通用大语言模型的多专家智能体用于解析中药复方机制

arXiv cs.CL · 6小时前 缓存

DeepTCM1.0是一个基于DeepSeek V3.2大语言模型构建的多专家智能体框架,用于解析中药复方的机制,通过Guizhi Decoction进行验证,并通过综合评分系统进行评估。

0 人收藏 0 人点赞

面向机器生成文本鲁棒水印检测的稳定性感知特征设计

arXiv cs.CL · 6小时前 缓存

本文介绍了模式稳定性得分(PSS),一种用于机器生成文本鲁棒水印检测的新框架,在AUC上实现了10-15个百分点的提升,并能在不同的LLMs和改写器之间泛化。

0 人收藏 0 人点赞

FraudBench:对基于政策的银行代理进行对抗自适应欺诈的压力测试

arXiv cs.AI · 6小时前 缓存

FraudBench 是一个可执行基准测试,用于对基于政策的银行代理进行对抗自适应欺诈攻击的压力测试,模拟具有工具、可变状态和内部政策文档的场景。

0 人收藏 0 人点赞

BERTilda: 通过相似性与流的时间图进行可解释的主题生命周期跟踪与分裂/合并检测

arXiv cs.CL · 6小时前 缓存

BERTilda是一个可解释的框架,通过构建带有相似性和流信号的时间图来跟踪纵向文本流中的主题生命周期,以检测分裂、合并和其他转变,并在标注数据集上达到高一致率。

0 人收藏 0 人点赞

利用AI改善农村药物安全:一项范围综述

arXiv cs.AI · 6小时前 缓存

这项范围综述探讨了AI技术如何在农村医疗环境中应用,以增强药物安全并减少错误,识别了AI的类型、效果和特定挑战。

0 人收藏 0 人点赞

计算东方主义:使用中东文化敏感度评分(MECSS)测量大语言模型中的结构性话语偏见

arXiv cs.CL · 6小时前 缓存

本文介绍了中东文化敏感度评分(MECSS),用于衡量大语言模型中的东方主义偏见,发现GPT-4和Falcon3-7B-Instruct系统地再现了这种结构性模式。

0 人收藏 0 人点赞

采用IEEE关键气体法与优化模糊逻辑的电力变压器故障诊断方法:基于溶解气体分析

arXiv cs.AI · 6小时前 缓存

本文介绍了一种结合IEEE关键气体法与优化模糊逻辑的方法,用于利用溶解气体分析诊断电力变压器故障,在实验验证中实现了高达98.6%的准确率。

0 人收藏 0 人点赞

Fractional Decay KV-Cache:所有权感知内存管理以提升对话系统中的推理相关性

arXiv cs.CL · 6小时前 缓存

提出 Fractional Decay KV-Cache (FD-KVC),一种用于对话系统的所有权感知内存管理算法,该算法使用双通道评分来提升推理相关性,在复合指标上优于 H2O +6.7%,并能更快适应话题变化。

0 人收藏 0 人点赞

安全对齐幻觉:LLMs中的跨语言安全差距

arXiv cs.AI · 6小时前 缓存

本文介绍了INCLUDE,一个多语言评估基准,用于量化LLMs中以印度为中心的社会文化偏见,揭示非英语印度语言比英语表现出更高的偏见,表明存在跨语言安全对齐差距。

0 人收藏 0 人点赞

FrenchNews-7: 跨发布者法国新闻编辑部分类基准测试

arXiv cs.CL · 6小时前 缓存

本文介绍了FrenchNews-7,一个用于跨多个发布者分类法国新闻编辑部的基准,特点是一个微调的CamemBERT分类器以及与LLM基线的评估。

0 人收藏 0 人点赞

立场:AI排行榜未能充分服务全球南方:印度案例研究

arXiv cs.AI · 6小时前 缓存

这篇立场论文认为,AI排行榜由于缺乏独立治理和利益冲突政策,结构性地不适合服务全球南方,并以印度为例,强调制度障碍并提出解决方案。

0 人收藏 0 人点赞

MAVEN:一个基于紧凑对齐评估器的多模态内容宏观社会价值评估框架

arXiv cs.CL · 6小时前 缓存

本文提出MAVEN,一个用于评估多模态内容宏观社会价值的分层框架,包含一个基准测试和优化评估器,以实现可扩展评估。

0 人收藏 0 人点赞

求解非绘制:奥赛几何中图表推理的基准

arXiv cs.AI · 6小时前 缓存

本文介绍了一个用于评估几何中图表推理的开源基准,揭示了尽管基础模型如GPT和Claude在解决问题上表现出色,但它们难以生成忠实的图表。

0 人收藏 0 人点赞

Agentic AI的兴起:关于演变、背景、工作原理、应用、采纳因素和未来研究方向的综述

arXiv cs.AI · 6小时前 缓存

本文对Agentic AI进行了系统性综述,讨论了其历史演变、架构、应用、挑战和未来研究方向。

0 人收藏 0 人点赞

语言模型与视觉语言模型中的后门学习

arXiv cs.CL · 6小时前 缓存

本文通过分析语言和视觉语言模型中的后门攻击,提出检测框架和新颖的攻击方法,并介绍针对临床应用的高效多模态模型,以解决人工智能中的安全性和效率问题。

0 人收藏 0 人点赞
← 上一页
下一页 →
← 返回首页

提交意见反馈