卡在独特的NLP难题上[D]
摘要
开发者寻求在不依赖大模型的情况下对英-印混写文本进行分类的建议,因为句子变换器在处理罗马化印地语时完全失效。
简单来说,我正在开发一款需要给文本打标签的应用。问题在于文本可能是纯英文、纯印地语,或者印地语+英文(用英文字母拼写的印地语)。我自然想到用句子变换器,但它对印地+英文混写文本的表现惨不忍睹——模型完全捕捉不到这类句子的语义。我知道上大模型能搞定,但会让应用变得太重。我也考虑过音译转写,可效果不准还会把文本弄坏。有人遇到过类似情况吗?该往哪个方向走?
相似文章
从词汇到AI:面向低资源语言专业对话系统的结构化数据流水线
提出了一种系统方法论,将印地语WordNet转换为125万条指令-响应对,并利用LoRA对12B参数语言模型进行微调,展示了在低资源语言专业对话系统中教学效果的显著提升。
通过自动预群超标签标注扩展印地语量子自然语言处理
本文将印地语自动预群超标签标注构想为量子自然语言处理中的词级分类任务,在一个低资源语料库上评估了多种方法,结果显示上下文回退和词汇修复的准确率约为64%,证明了可扩展的多语言QNLP流水线的可行性。
通过多阶段LLM流程的结构保持文档翻译:以马拉地语为例
本文提出了一种多阶段LLM流程,用于政府文档的结构保持型马拉地语到英语翻译,集成了布局感知OCR和HTML重构,以维护格式和领域术语。
代码混合语音强制对齐的评估:以印地语-英语为例
本文使用Montreal Forced Aligner评估印地语-英语代码混合语音的强制对齐,证明引导策略和代码混合训练数据相比单语替代方案,对齐精度提高了十倍。
Multilingual-Multimodal-NLP/LoopCoder-V2 · Hugging Face
LoopCoder-V2 是一个基于 Parallel Loop Transformer (PLT) 构建的 7B 参数指令调优代码模型,展示了非单调测试时扩展特性,其中两个循环提供了最佳的收益-成本权衡,并在代码生成和推理基准测试上显著优于基线模型。