multilingual-evaluation

标签

Cards List
#multilingual-evaluation

技能差异:LLM中的技能是否具有语言不变性?

Hugging Face Daily Papers · 3天前 缓存

本文通过基于文本游戏的多语言自我对弈,量化了大语言模型在跨语言技能上的不一致性,揭示了不同语言间显著的性能差异,且这种差异可通过改变中间推理语言得到部分缓解。

0 人收藏 0 人点赞
#multilingual-evaluation

HealMed:医学领域大语言模型的多语言评估

arXiv cs.CL · 2026-08-21 缓存

HealMed 是一个由专家审核的基准测试,用于评估医学领域大语言模型在九种语言上的表现,由医学专家开发以评估临床任务中的多语言性能。

0 人收藏 0 人点赞
#multilingual-evaluation

检索失败在哪里?评估农业咨询中的RAG架构

arXiv cs.CL · 2026-08-18 缓存

本文评估了RAG系统在孟加拉语农业咨询中的检索质量,发现性能因查询类型和语言条件而异,并引入了一个基准数据集,以强调在低资源环境中进行分层评估的必要性。

0 人收藏 0 人点赞
#multilingual-evaluation

UA-Legal-Bench:评估大语言模型在乌克兰法律推理能力的基准

arXiv cs.CL · 2026-05-29 缓存

介绍了UA-Legal-Bench,这是一个基于统一国家法院判决登记册构建的、用于评估大语言模型在乌克兰法律推理能力的五项任务基准。评估了11个LLM,揭示了任务相关的少样本效应以及在不平衡法律任务中准确率的误导性。

0 人收藏 0 人点赞
#multilingual-evaluation

GaoYao基准:全面评估大模型多语言与多文化能力的新框架

arXiv cs.CL · 2026-04-23 缓存

GaoYao发布18.2万样本、覆盖26种语言与51个地区的基准,系统评测大模型多语言与多文化能力,首次揭示显著地域性能差异。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈