教 Nemotron 学希腊语:面向专业领域的语料挖掘、检索适配与有依据的生成

Hugging Face Daily Papers 论文

摘要

本文介绍了对 NVIDIA 的 Nemotron 检索栈进行的端到端适配,使其适用于现代希腊语,包括新基准 HERA,以及在专业领域针对检索、重排序和有依据的生成进行微调的模型。

尽管现代希腊语在法律、能源、金融和医疗等应用中的检索增强生成(RAG)中非常重要,但它并未包含在 NVIDIA 的 Nemotron 检索模型以及主要的多语言检索基准中。我们提出了对 Nemotron 检索栈的端到端适配,使其适用于现代希腊语,包括语料库挖掘、合成监督、检索模型训练、重排序器适配、阅读器微调,以及一个名为 HERA 的新基准。我们的研究表明,无参数的 BM25 基线在专业希腊语语料库上优于几种现成的多语言稠密检索模型。在 65,773 个希腊语检索对上微调后,Nemotron 1B 嵌入器将 nDCG@10 从 0.362 提高到 0.835,并大幅优于未适配的对应模型。所学的语言能力可迁移到通用领域的希腊语,但相对于 BM25 的优势仍然依赖于领域。我们进一步适配了一个交叉编码器重排序器,并在各个专业领域展示了持续的改进。最后,我们对 Nemotron 30B-A3B 混合专家阅读器进行了 LoRA 微调以进行有依据的生成,将判定答案的正确率从 29.4% 提高到 66.9%,同时显著提高了忠实度和引用质量。我们还推出了 HERA,这是第一个大规模希腊语检索增强生成基准,并发布了我们适配的模型和基准,以支持未来关于希腊语 RAG 系统的研究。
查看原文
查看缓存全文

缓存时间: 2026/08/07 09:56

论文页面 - 教授 Nemotron 希腊语:挖掘语料库、适配检索、并将生成扎根于现代希腊语专业领域

来源:https://huggingface.co/papers/2608.05138

摘要

尽管现代希腊语在法律、能源、金融和医疗应用的检索增强生成(RAG)中非常重要,但它缺失于 NVIDIA 的 Nemotron 检索模型以及主要的多语种检索基准中。我们提出了对 Nemotron 检索栈进行端到端适配的现代希腊语方案,包括语料库挖掘、合成监督数据、检索模型训练、重排序器适配、阅读器微调,以及一个名为 HERA 的新基准。我们的研究表明,在专业希腊语语料库上,无需参数训练的 BM25 基线优于多种现成的多语种稠密检索模型。在对 65,773 个希腊语检索对进行微调后,Nemotron 1B 嵌入模型的 nDCG@10 从 0.362 提升到 0.835,并显著优于其未适配版本。所习得的语言能力可以迁移到通用领域的希腊语,尽管相比 BM25 的优势仍取决于领域。我们进一步适配了跨编码器重排序器,并展示了在专业领域中的持续改进。最后,我们对 Nemotron 30B-A3B 混合专家阅读器进行了 LoRA 微调以实现扎根生成,使人工评定的答案正确率从 29.4% 提升到 66.9%,同时显著提高了忠实度和引文质量。我们还推出了 HERA,这是首个大规模希腊语检索增强生成基准,并发布了我们适配后的模型和基准,以支持未来对希腊语 RAG 系统的研究。

查看 arXiv 页面 (https://arxiv.org/abs/2608.05138)查看 PDF (https://arxiv.org/pdf/2608.05138)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.05138)

引用此论文的模型0

没有模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2608.05138 即可从此页面关联该模型。

引用此论文的数据集0

没有数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.05138 即可从此页面关联该数据集。

引用此论文的 Space0

没有 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2608.05138 即可从此页面关联该 Space。

包含此论文的收藏1

相似文章

使用合成数据构建快速多语言OCR模型

Hugging Face Blog

NVIDIA推出Nemotron OCR v2,一个使用合成数据生成技术构建的快速多语言OCR模型。该模型通过采用统一的基于FOTS的架构,在检测、识别和关系组件之间实现特征复用,在单个A100 GPU上达到34.7页/秒的性能。

HEBATRON:一款专攻希伯来语的开权重大语言模型

arXiv cs.CL

Hebatron 是一款基于 NVIDIA Nemotron-3 混合专家(MoE)架构构建的、专攻希伯来语的新开源权重大型语言模型。该模型在实现高效推理的同时展现出强大的推理能力。它是首个针对该架构进行的语言特定适配版本,并支持原生长上下文处理。