提示语言与翻译理论驱动的提示在大型语言模型中的作用:以西中新闻翻译为例
摘要
本研究探讨了提示语言和翻译理论驱动的提示设计如何影响GPT-5.2生成的西中新闻翻译质量,发现尽管自动化指标偏好基线提示,但在专家评估下,理论驱动提示改善了文体。
arXiv:2607.03160v1 公告类型:新提交
摘要:本研究考察了提示语言和翻译理论驱动的提示设计如何影响GPT-5.2生成的西班牙语-中文新闻翻译质量。一个由《国家报》四篇社论组成的平行语料库在48个实验条件下(4种提示类型、3种提示语言和4篇文章)进行了翻译。翻译质量通过BLEU和BERTScore-F1进行自动评估,同时基于多维质量指标框架进行人工评估。自动评估指标将基线提示识别为表现最佳的条件,而人工评估则将简报导向提示评为最高(MQM:8.66 vs 7.84),这一反转可能归因于自动测量中固有的单参考文献限制。子错误类型分析显示,翻译理论驱动的提示有选择地减少了尴尬风格错误,而不地道风格错误在各条件下持续存在。在两种评估范式下,提示语言的影响均可忽略不计。这些结果表明,在专家评估新闻翻译时,翻译理论驱动的提示可以带来可衡量的质量提升,尽管其对语言学习者的教学意义仍具暗示性,需要通过基于用户的研究进行验证。
查看缓存全文
缓存时间: 2026/07/07 04:37
# 提示语言与翻译理论驱动提示在大语言模型中的作用:以西中新闻翻译为例 来源:https://arxiv.org/abs/2607.03160 查看 PDF (https://arxiv.org/pdf/2607.03160) > 摘要:本研究探讨了提示语言及翻译理论驱动的提示设计如何影响 GPT-5.2 生成的西中新闻翻译质量。研究以《国家报》四篇社论为平行语料,在48种实验条件(4种提示类型、3种提示语言、4篇文章)下进行翻译。翻译质量采用 BLEU 和 BERTScore-F1 进行自动评估,同时基于多维质量指标(MQM)框架进行人工评估。自动评估指标显示基准提示(BASE)为最优条件,而人工评估则将简要导向提示(BRIEF)评为最高(MQM:8.66 vs. 7.84),这种反转可能源于自动评估方法固有的单参考约束。子错误类型分析表明,翻译理论驱动的提示可选择性减少生硬风格错误,而不地道风格错误在所有条件下依然存在。提示语言在两种评估范式下影响均微乎其微。这些结果表明,在新闻翻译的专家评估中,翻译理论驱动的提示能够带来可量化的质量提升,但其对语言学习者的教学意义仍具提示性,需通过用户研究进一步验证。 ## 提交历史 来自:赖浩鸿 [查看邮件 (https://arxiv.org/show-email/48086053/2607.03160)] **\[v1\]** 2026年7月3日星期五 09:59:36 UTC (508 KB)
相似文章
并非放之四海而皆准:多语言大语言模型中从固定提示到可学习路由的演进
# 并非放之四海而皆准:多语言大语言模型中从固定提示到可学习路由的演进 来源:[https://arxiv.org/html/2604.16937](https://arxiv.org/html/2604.16937) Wei-Chi Wu, Sheng-Lun Wei, Hen-Hsen Huang, Hsin-Hsi Chen α 台湾大学电脑科学与资讯工程学系,台湾 β 中央研究院资讯科学研究所,台湾 γ 台湾大学人工智能研究中心(AINTU),台湾 wcwu@c
提示语言影响大型语言模型的诊断推理和准确性
本研究评估了提示语言(英语与法语)如何影响五个大型语言模型的诊断推理和准确性,使用了180个临床案例,发现大多数模型在英语下表现显著更好,只有o3是例外。
使用探针目标归因定位大型语言模型中的提示模糊性
介绍了PRIG,一种梯度归因方法,通过训练线性探针区分清晰提示和模糊提示,并将探针得分归因于残差流中的标记表示,从而定位大型语言模型中的提示模糊性,在合成和人工编写的基准测试上取得了强劲性能。
使用认知模型改进语言模型对人类说服游戏的模拟
本文提出方程到行为提示和强化学习,引导大型语言模型模拟说服游戏中多样的人类决策模式,显示出改进的信念准确性和训练结果。
通过风格引导提示解释风格表示
本文提出了一个通过使用风格引导提示(即自然语言指令,引导大语言模型生成具有特定风格属性的文本)来解读风格表示的框架。该方法在描述和模仿写作风格方面均优于基线大语言模型提示技术。