标签
本研究探究了基于单语数据训练的幻觉检测探针在Hinglish上的迁移效果,结果显示检测性能稳健,且Hindi和Hinglish中的幻觉率高于英语。
本文介绍了PERCEPT,这是首个从X、Instagram和Digikala收集的大规模波斯语-英语代码混合语料库,标注了Universal Dependencies词性标签。文章提出了一种LLM辅助的标注框架,并分析了不同平台上的代码混合模式。
提出一个统一框架LCF和LCFEdit,联合优化使用低资源语言为LLMs生成代码混合指纹的构造与注入过程,以实现不可察觉且鲁棒的所有权验证。
介绍了Indi-RomCoM,这是一个用于评估LLM在四种印度语言罗马化代码混合(RCM)指令上的基准,发现LLM在RCM任务上表现不佳,且性能随代码混合密度增加而下降。