教 Nemotron 学希腊语:面向专业领域的语料挖掘、检索适配与有依据的生成
摘要
本文介绍了对 NVIDIA 的 Nemotron 检索栈进行的端到端适配,使其适用于现代希腊语,包括新基准 HERA,以及在专业领域针对检索、重排序和有依据的生成进行微调的模型。
查看缓存全文
缓存时间: 2026/08/07 09:56
论文页面 - 教授 Nemotron 希腊语:挖掘语料库、适配检索、并将生成扎根于现代希腊语专业领域
来源:https://huggingface.co/papers/2608.05138
摘要
尽管现代希腊语在法律、能源、金融和医疗应用的检索增强生成(RAG)中非常重要,但它缺失于 NVIDIA 的 Nemotron 检索模型以及主要的多语种检索基准中。我们提出了对 Nemotron 检索栈进行端到端适配的现代希腊语方案,包括语料库挖掘、合成监督数据、检索模型训练、重排序器适配、阅读器微调,以及一个名为 HERA 的新基准。我们的研究表明,在专业希腊语语料库上,无需参数训练的 BM25 基线优于多种现成的多语种稠密检索模型。在对 65,773 个希腊语检索对进行微调后,Nemotron 1B 嵌入模型的 nDCG@10 从 0.362 提升到 0.835,并显著优于其未适配版本。所习得的语言能力可以迁移到通用领域的希腊语,尽管相比 BM25 的优势仍取决于领域。我们进一步适配了跨编码器重排序器,并展示了在专业领域中的持续改进。最后,我们对 Nemotron 30B-A3B 混合专家阅读器进行了 LoRA 微调以实现扎根生成,使人工评定的答案正确率从 29.4% 提升到 66.9%,同时显著提高了忠实度和引文质量。我们还推出了 HERA,这是首个大规模希腊语检索增强生成基准,并发布了我们适配后的模型和基准,以支持未来对希腊语 RAG 系统的研究。
查看 arXiv 页面 (https://arxiv.org/abs/2608.05138)查看 PDF (https://arxiv.org/pdf/2608.05138)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.05138)
引用此论文的模型0
没有模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2608.05138 即可从此页面关联该模型。
引用此论文的数据集0
没有数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.05138 即可从此页面关联该数据集。
引用此论文的 Space0
没有 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2608.05138 即可从此页面关联该 Space。
包含此论文的收藏1
相似文章
NVIDIA Nemotron 3 Embed 在RTEB整体排名第一,推动智能检索发展
NVIDIA发布Nemotron 3 Embed,这是一组开源嵌入模型,在RTEB排行榜上名列前茅,包括一个80亿参数的旗舰模型以及适用于生产规模检索的高效10亿参数变体。
从多语言流式ASR骨干网络到肯尼亚语系系统:面向基库尤语、多洛语和卡伦津语的Nemotron 3.5数据驱动适配
本文介绍了一项工程研究,将NVIDIA Nemotron 3.5 ASR Streaming 0.6B适配到基库尤语、多洛语和卡伦津语中。通过语料库审计、规范化、流式评估等数据驱动技术,在内部测试集上分别实现了基库尤语42.97%和多洛语33.98%的词错误率(WER)。
使用合成数据构建快速多语言OCR模型
NVIDIA推出Nemotron OCR v2,一个使用合成数据生成技术构建的快速多语言OCR模型。该模型通过采用统一的基于FOTS的架构,在检测、识别和关系组件之间实现特征复用,在单个A100 GPU上达到34.7页/秒的性能。
NVIDIA 发布了 Nemotron-TwoTower-30B-A3B-Base-BF16,这是一种基于 Nemotron 3 Nano 30B-A3B 主干构建的异常扩散型语言模型。
NVIDIA 发布了 Nemotron-TwoTower-30B-A3B-Base-BF16,这是一种基于扩散的语言模型,采用逐块自回归扩散方法,通过对令牌块进行迭代去噪来生成文本,实现了自回归基线 2.42 倍的生成吞吐量,同时保留了基准测试质量 98.7% 的水平。
HEBATRON:一款专攻希伯来语的开权重大语言模型
Hebatron 是一款基于 NVIDIA Nemotron-3 混合专家(MoE)架构构建的、专攻希伯来语的新开源权重大型语言模型。该模型在实现高效推理的同时展现出强大的推理能力。它是首个针对该架构进行的语言特定适配版本,并支持原生长上下文处理。