最新

全部文章,按抓取时间从新到旧排列。

Cards List

针对资源匮乏语言仇恨言论检测的LLM高效适应:罗马乌尔都语的比较研究

arXiv cs.AI · 8小时前 缓存

本文评估了大语言模型在罗马乌尔都语(一种资源匮乏语言)中的仇恨言论检测能力,证明使用LoRA的参数高效微调相比零样本推理显著提升了分类性能。

0 人收藏 0 人点赞

DeepTCM1.0:基于通用大语言模型的多专家智能体用于解析中药复方机制

arXiv cs.CL · 8小时前 缓存

DeepTCM1.0是一个基于DeepSeek V3.2大语言模型构建的多专家智能体框架,用于解析中药复方的机制,通过Guizhi Decoction进行验证,并通过综合评分系统进行评估。

0 人收藏 0 人点赞

面向机器生成文本鲁棒水印检测的稳定性感知特征设计

arXiv cs.CL · 8小时前 缓存

本文介绍了模式稳定性得分(PSS),一种用于机器生成文本鲁棒水印检测的新框架,在AUC上实现了10-15个百分点的提升,并能在不同的LLMs和改写器之间泛化。

0 人收藏 0 人点赞

FraudBench:对基于政策的银行代理进行对抗自适应欺诈的压力测试

arXiv cs.AI · 8小时前 缓存

FraudBench 是一个可执行基准测试,用于对基于政策的银行代理进行对抗自适应欺诈攻击的压力测试,模拟具有工具、可变状态和内部政策文档的场景。

0 人收藏 0 人点赞

BERTilda: 通过相似性与流的时间图进行可解释的主题生命周期跟踪与分裂/合并检测

arXiv cs.CL · 8小时前 缓存

BERTilda是一个可解释的框架,通过构建带有相似性和流信号的时间图来跟踪纵向文本流中的主题生命周期,以检测分裂、合并和其他转变,并在标注数据集上达到高一致率。

0 人收藏 0 人点赞

利用AI改善农村药物安全:一项范围综述

arXiv cs.AI · 8小时前 缓存

这项范围综述探讨了AI技术如何在农村医疗环境中应用,以增强药物安全并减少错误,识别了AI的类型、效果和特定挑战。

0 人收藏 0 人点赞

计算东方主义:使用中东文化敏感度评分(MECSS)测量大语言模型中的结构性话语偏见

arXiv cs.CL · 8小时前 缓存

本文介绍了中东文化敏感度评分(MECSS),用于衡量大语言模型中的东方主义偏见,发现GPT-4和Falcon3-7B-Instruct系统地再现了这种结构性模式。

0 人收藏 0 人点赞

采用IEEE关键气体法与优化模糊逻辑的电力变压器故障诊断方法:基于溶解气体分析

arXiv cs.AI · 8小时前 缓存

本文介绍了一种结合IEEE关键气体法与优化模糊逻辑的方法,用于利用溶解气体分析诊断电力变压器故障,在实验验证中实现了高达98.6%的准确率。

0 人收藏 0 人点赞

Fractional Decay KV-Cache:所有权感知内存管理以提升对话系统中的推理相关性

arXiv cs.CL · 8小时前 缓存

提出 Fractional Decay KV-Cache (FD-KVC),一种用于对话系统的所有权感知内存管理算法,该算法使用双通道评分来提升推理相关性,在复合指标上优于 H2O +6.7%,并能更快适应话题变化。

0 人收藏 0 人点赞

安全对齐幻觉:LLMs中的跨语言安全差距

arXiv cs.AI · 8小时前 缓存

本文介绍了INCLUDE,一个多语言评估基准,用于量化LLMs中以印度为中心的社会文化偏见,揭示非英语印度语言比英语表现出更高的偏见,表明存在跨语言安全对齐差距。

0 人收藏 0 人点赞

FrenchNews-7: 跨发布者法国新闻编辑部分类基准测试

arXiv cs.CL · 8小时前 缓存

本文介绍了FrenchNews-7,一个用于跨多个发布者分类法国新闻编辑部的基准,特点是一个微调的CamemBERT分类器以及与LLM基线的评估。

0 人收藏 0 人点赞

立场:AI排行榜未能充分服务全球南方:印度案例研究

arXiv cs.AI · 8小时前 缓存

这篇立场论文认为,AI排行榜由于缺乏独立治理和利益冲突政策,结构性地不适合服务全球南方,并以印度为例,强调制度障碍并提出解决方案。

0 人收藏 0 人点赞

MAVEN:一个基于紧凑对齐评估器的多模态内容宏观社会价值评估框架

arXiv cs.CL · 8小时前 缓存

本文提出MAVEN,一个用于评估多模态内容宏观社会价值的分层框架,包含一个基准测试和优化评估器,以实现可扩展评估。

0 人收藏 0 人点赞

求解非绘制:奥赛几何中图表推理的基准

arXiv cs.AI · 8小时前 缓存

本文介绍了一个用于评估几何中图表推理的开源基准,揭示了尽管基础模型如GPT和Claude在解决问题上表现出色,但它们难以生成忠实的图表。

0 人收藏 0 人点赞

Agentic AI的兴起:关于演变、背景、工作原理、应用、采纳因素和未来研究方向的综述

arXiv cs.AI · 8小时前 缓存

本文对Agentic AI进行了系统性综述,讨论了其历史演变、架构、应用、挑战和未来研究方向。

0 人收藏 0 人点赞

语言模型与视觉语言模型中的后门学习

arXiv cs.CL · 8小时前 缓存

本文通过分析语言和视觉语言模型中的后门攻击,提出检测框架和新颖的攻击方法,并介绍针对临床应用的高效多模态模型,以解决人工智能中的安全性和效率问题。

0 人收藏 0 人点赞

自我演化智能体作为动态图变换:综述与新视角

arXiv cs.AI · 8小时前 缓存

本文综述将自我演化LLM智能体与动态图变换联系起来,提出一个框架将智能体状态建模为动态图,并组织现有方法以促进其演化。

0 人收藏 0 人点赞

NE-BERT: 针对九种东北印度语言的多语言模型

arXiv cs.CL · 8小时前 缓存

NE-BERT 是一个多语言编码器模型,在830万句数据上训练,覆盖九种东北印度语言和两种锚定语言,通过自定义分词技术,在超低资源语言上显著优于现有模型如 IndicBERT-V2 和 MuRIL。

0 人收藏 0 人点赞

FinSkillBench: 评估投资管理领域的AI代理和领域技能

arXiv cs.AI · 8小时前 缓存

FinSkillBench是一个针对投资管理领域AI代理的评估套件,表明精心策划的程序化技能相比自生成技能能提升性能。

0 人收藏 0 人点赞

通过拒绝别名缓解Abliteration

arXiv cs.CL · 8小时前 缓存

本文介绍了AMRA,一种权重编辑方法,通过模糊拒绝信号来缓解大型语言模型中的Abliteration,在Llama-3-8B和Gemma-2-9B上提升消融后的拒绝分数,同时最小化效用下降。

0 人收藏 0 人点赞
← 上一页
下一页 →
← 返回首页

提交意见反馈