Wazobia Eval:尼日利亚皮钦语情感理解、讽刺检测与文化推理基准
摘要
Wazobia Eval 是一个旨在评估AI模型在尼日利亚皮钦语情感理解、讽刺检测和文化推理方面的基准,旨在提升该语言的自然语言处理能力。
arXiv:2608.21369v1 Announce Type: new
Abstract: 尼日利亚皮钦语是非洲使用最广泛的语言之一,但在语言模型评估中仍严重缺乏代表性。现有基准主要关注翻译、转录或通用情感分析,未能衡量文化语境下的语言理解关键方面。我们推出了 Wazobia Eval,一个用于评估尼日利亚皮钦语情感理解、讽刺检测和文化推理的基准。该基准基于一个手工标注的数据集,包含超过550个示例和一个16类情感分类体系,旨在捕捉传统情感框架中未涵盖的文化特定情感表达。Wazobia Eval 提供标准化的评估协议和基准任务,以评估模型在细致尼日利亚语言理解方面的性能。我们展示了基准设计、标注方法、分类体系开发过程和初步试点评估结果。我们的目标是为尼日利亚语言AI提供基础评估基础设施,并建立一个可重复的基准以供未来研究。数据集可在 https://huggingface.co/WAZOBIALABS 公开获取。
查看缓存全文
缓存时间: 2026/08/25 04:09
# Wazobia 评估基准:尼日利亚皮钦语情感理解、反讽检测与文化推理 来源:https://arxiv.org/abs/2608.21369 书目工具 ## 书目与引用工具 书目探索器开关 代码、数据与媒体 ## 与本文相关的代码、数据及媒体 演示 ## 演示 相关论文 ## 推荐工具与检索 关于 arXivLabs ## arXivLabs:与社区协作者共同推进的实验性项目 arXivLabs 是一个开放框架,允许协作者在 arXiv 官网直接开发与共享新功能。 所有使用 arXivLabs 的个人与组织均已认同并践行我们的开放、社区、卓越及用户隐私保护价值观。arXiv 坚守这些原则,仅与遵循同等标准的合作伙伴开展协作。 您是否有能为 arXiv 社区创造价值的项目构想?**深入了解 arXivLabs** (https://info.arxiv.org/labs/index.html)。
相似文章
VIVID:一个植根于文化的基准,揭示越南语自然语言处理中的比喻语言差距
本文介绍了VIVID,这是首个系统评估越南语中植根于文化的比喻语言理解的基准,包含1,636条习语和谚语。对八个最先进模型的评估揭示了显著差距:越南语专用模型的表现远逊于多语言系统,即使顶尖模型平均正确率也不到50%。
SpeechEQ:在社交感知语音对话模型中评估情商指数的基准
SpeechEQ引入了一个用于评估语音语言模型情商的基准和数据集,涵盖2,265个对话中的15个情商子量表。实验表明,当前模型在处理副语言线索时存在困难,表现出依赖文本的捷径以及其他局限性。
CAREBench:通过评估认知评价推理来检验LLM的情感理解能力
介绍CAREBench,一个基于评价理论的基准测试,通过认知评价推理评估LLM的情感理解能力,表明当前模型在推理和积极情绪识别方面存在困难,尽管在某些下游任务上与人类表现相当。
语言模型中的评估意识:表征、表达与控制
本文系统地研究了语言模型中的评估意识,表明模型内化了评估语境,导致内部表征、语言表达和导向行为之间的脱节,对基准可靠性有影响。
Inspect India Evals:面向印度语言文化语境的大语言模型开放评估框架
介绍Inspect India Evals,一个用于在印度语言文化语境中评估大语言模型的开源框架,包含六项基准测试,涵盖多语言能力、偏见、安全性和文化知识。对五个模型的测试显示,Sarvam-M 24B和Gemma 2 27B表现领先。