arabic

标签

Cards List
#arabic

弥合英语-阿拉伯语医学知识鸿沟:基于因果层选择的定向低秩适配

arXiv cs.CL · 2026-08-04 缓存

本文探讨了LLM在阿拉伯语医学任务中表现不佳的原因,通过机制分析表明知识存在于模型内部但未能浮现,随后提出了TLoRA,一种定向低秩适配方法,在医学问答上优于全网络LoRA,并引入了一个新的阿拉伯语临床对话基准。

0 人收藏 0 人点赞
#arabic

AHA-Memes:用于理解阿拉伯语迷因中仇恨的细粒度多模态基准

arXiv cs.CL · 2026-07-31 缓存

本文介绍了 AHA-Memes,这是首个具有细粒度多标签注释的大规模阿拉伯语仇恨迷因基准,包含 5K 条人工注释和约 66K 条银标签迷因,并评测了多种多模态模型在基于文化的仇恨检测中的表现。

0 人收藏 0 人点赞
#arabic

受限CTC解码实现高效变音符号恢复

arXiv cs.CL · 2026-07-22 缓存

本文提出了一种基于CTC的非自回归方法,用于阿拉伯语语音到文本的变音符号恢复,在解码过程中引入硬约束以提高效率并降低错误率。

0 人收藏 0 人点赞
#arabic

方言能否像语言一样被引导?阿拉伯语大语言模型中的稀疏神经元与分布式方向

arXiv cs.CL · 2026-07-07 缓存

本文研究了通过识别稀疏神经元群体和提取方言激活方向来引导阿拉伯语大语言模型生成特定方言的方法,从而在不进行微调的情况下实现推理时的方言控制。

0 人收藏 0 人点赞
#arabic

我给我的语音代理更换了TTS,结果它比任何其他方式都更有效地减少了人们实际感受到的延迟

Reddit r/AI_Agents · 2026-07-06

作者分享了将语音代理中的TTS替换为专为双语(阿拉伯语和英语)对话设计的自定义模型(Banter 1)的经验,这显著降低了感知延迟。

0 人收藏 0 人点赞
#arabic

PAST-TIDE: 基于原型锚定的语句调优与话题不变归一化用于立场检测

Hugging Face Daily Papers · 2026-07-06 缓存

PAST-TIDE是StanceNakba共享任务的一个立场检测系统,采用完形填空式掩码语言建模的语句调优、原型对比学习和话题条件层归一化进行跨话题阿拉伯语立场检测,在子任务A和B上分别达到了0.75和0.74的宏F1分数。

0 人收藏 0 人点赞
#arabic

土耳其语和阿拉伯语中的仇恨言论检测:一项综合研究

arXiv cs.CL · 2026-07-02 缓存

介绍了针对土耳其语和阿拉伯语的全面仇恨言论数据集,并开发了基于BERT的最先进模型,用于仇恨言论分析,包括分类、强度预测、目标识别和跨度检测。

0 人收藏 0 人点赞
#arabic

前沿LLM在阿拉伯文化和社会语言学知识上的基准测试:一个带有人类专家真值的交叉评估框架

arXiv cs.CL · 2026-07-02 缓存

本文介绍了一个交叉评估框架,用于在阿拉伯文化和社会语言学知识上对LLM进行基准测试,使用人类专家真值和自动评审。作者贡献了一个针对埃及和伊拉克阿拉伯语的提示-评分标准对数据集,评估了前沿LLM,并发现文化推理仍然是自动评分的主要失败模式。

0 人收藏 0 人点赞
#arabic

连接科学遗产:面向可持续知识转移的阿拉伯语-俄语平行语料库与大语言模型基准

arXiv cs.CL · 2026-07-01 缓存

本文提出了一个阿拉伯语-俄语科学翻译的基准,包括一个包含27,000个句对的混合平行语料库,以及使用LoRA微调的多语言模型(mT5、NLLB、Qwen)。最佳模型达到了BLEU分数23.15,该工作旨在降低阿拉伯语和俄语研究人员之间科学知识交流的语言障碍。

0 人收藏 0 人点赞
#arabic

CohereLabs/cohere-transcribe-arabic-07-2026

Hugging Face Models Trending · 2026-06-18 缓存

Cohere 发布了一个开源的 2B 参数阿拉伯语 ASR 模型,该模型基于 Conformer 编码器-解码器架构,针对阿拉伯方言性能和阿拉伯语-英语代码切换进行了优化。

0 人收藏 0 人点赞
#arabic

当相似意味着不同:评估LLM在阿拉伯语-希伯来语同源词上的表现

arXiv cs.CL · 2026-06-12 缓存

本文介绍了SemCog Bench,这是一个精心整理的基准测试,包含1,858个阿拉伯语-希伯来语词对,并带有句子级别的注释,用于评估LLM区分真同源词、假同源词和借词的能力。结果显示,模型在真同源词上准确率很高,但在假同源词上准确率大幅下降,突显了跨语言语义推理中的一个关键局限性。

0 人收藏 0 人点赞
#arabic

ArabiGEE:阿拉伯语语法错误解释的分层分类法

arXiv cs.CL · 2026-06-10 缓存

介绍ArabiGEE,这是首个全面的阿拉伯语语法错误解释分类法,采用分层结构,涵盖拼写、形态、句法和词汇维度,包含27种错误类型、140种修正类型和324个解释。

0 人收藏 0 人点赞
#arabic

Almieyar-Oryx-BloomBench:一种用于认知驱动评估视觉语言模型的双语多模态基准

Hugging Face Daily Papers · 2026-06-04 缓存

BloomBench是一个基于认知理论的双语(英语-阿拉伯语)多模态视觉语言模型基准,系统评估基于布鲁姆分类学的六个认知层次。实验揭示了当前模型中显著的认知不对称和跨语言性能差距。

0 人收藏 0 人点赞
#arabic

AraHopeCorpus:阿拉伯社交媒体危机话语中希望言论的标注指南与数据集

arXiv cs.CL · 2026-05-25 缓存

本文介绍了AraHopeCorpus,这是首个针对阿拉伯社交媒体中希望言论的标注数据集,数据来自关于加沙战争的YouTube评论。文章提供了详细的标注框架和分析,表明希望性语言在危机话语中占主导地位。

0 人收藏 0 人点赞
#arabic

词根与模式屈折形态学:阿拉伯语破碎复数

arXiv cs.CL · 2026-05-22 缓存

提出了一种新颖的词根与模式模型来描述阿拉伯语名词的屈折形态,重点关注破碎复数,包含160个类别的分类法以及应用于3200个词条的编码方案,旨在改进计算语言资源。

0 人收藏 0 人点赞
#arabic

ArabDiscrim:一个关于种族主义与歧视的十年阿拉伯语Facebook语料库

arXiv cs.CL · 2026-05-22 缓存

ArabDiscrim是一个跨越十年的词汇资源与语料库,包含293K条关于种族主义和歧视的阿拉伯语Facebook帖子,并整合了互动信号、形态正则词族以及歧视轴,旨在支持面向公平性的阿拉伯语自然语言处理研究。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈