将古典诗歌翻译成现代散文
摘要
介绍Padyam2Gadyam数据集,该数据集用于将13至17世纪泰卢固语古典诗歌翻译成现代泰卢固语和英语散文,并评估了五种大语言模型在此任务上的表现。
arXiv:2606.02806v1 公告类型:新
摘要:我们推出了Padyam2Gadyam数据集,用于将13至17世纪泰卢固语古典诗歌翻译成当代泰卢固语和英语散文。该数据集包含600首诗及其经过人工验证的泰卢固语和英语散文译本。我们评估了5种当代大语言模型(LLMs)在将诗歌翻译成泰卢固语和英语方面的能力。结果表明,尽管不同LLMs之间存在差异,但它们的整体表现在这两种语言上仍有很大的提升空间。通过定性分析,我们讨论了当代机器翻译评估方法在此任务中的能力和局限性。
查看缓存全文
缓存时间: 2026/06/03 09:35
# 将古典诗歌翻译为现代散文 来源:https://arxiv.org/abs/2606.02806 查看 PDF (https://arxiv.org/pdf/2606.02806) > 摘要:我们提出了 Padyam2Gadyam,这是一个用于将 13 世纪至 17 世纪的泰卢固语古典诗歌翻译为当代泰卢固语和英语散文的数据集。该数据集包含 600 首诗歌及其经过人工核验的泰卢固语和英语散文翻译。我们评估了 5 个当代大型语言模型 (LLM) 在将诗歌翻译为泰卢固语和英语散文方面的能力。结果表明,尽管不同 LLM 之间存在差异,但其整体表现在两种语言中仍有很大的改进空间。通过定性分析,我们探讨了当前机器翻译评估方法在此任务中的能力与局限性。 ## 提交历史 来自:Kranti Chalamalasetti [查看邮箱 (https://arxiv.org/show-email/7e1fe74b/2606.02806)] **[v1]** 2026 年 6 月 1 日星期一 19:24:50 UTC (521 KB)
相似文章
通过多阶段LLM流程的结构保持文档翻译:以马拉地语为例
本文提出了一种多阶段LLM流程,用于政府文档的结构保持型马拉地语到英语翻译,集成了布局感知OCR和HTML重构,以维护格式和领域术语。
一个逐词数字阅读器,用于《普拉斯塔纳特罗伊》及商羯罗注疏:语料库、方法及面向不二论吠檀多经典的开源离线阅读辅助工具
介绍了一个开源的离线逐词数字阅读器,用于《普拉斯塔纳特罗伊》及商羯罗注疏,具有可点击的词分析、索引功能,以及结合规则和LLM辅助方法的混合流水线。
PaliBench:面向古典语言翻译基准的多参考蓝图
介绍PaliBench,一个用于巴利语到英语翻译的多参考基准,采用多位学者的独立翻译,并提供一种可复用的方法论,用于为古典语言创建类似的基准测试。
从输入端最小化模态差距:您的语音大语言模型可以成为具备韵律感知能力的文本大语言模型
提出了 TextPro-SLM,一种通过处理口语输入使其类似于具备韵律感知能力的文本来最小化模态差距的语音大语言模型,以少量的训练数据实现了强大的副语言理解能力。
卡在独特的NLP难题上[D]
开发者寻求在不依赖大模型的情况下对英-印混写文本进行分类的建议,因为句子变换器在处理罗马化印地语时完全失效。