论使用LLM处理专业术语:语料库的良好替代方案?
摘要
本研究评估了四款专有LLM(GPT-4o、GPT-5.2、Claude Sonnet 4.5、DeepSeek)在两个领域英译法的专业术语翻译,并比较了提示策略。结果显示Claude Sonnet 4.5表现最佳,但LLM目前尚无法取代专业语料库。
arXiv:2607.24784v1 公告类型:新
摘要:专业翻译依赖文献和术语资源,包括语料库。这些资源对术语处理尤为有用。然而,其编制和利用存在若干局限:需要时间、技术技能以及获取难以收集的数据。本研究考察LLM在多大程度上能协助专业翻译人员寻找英译法的对等词。我们评估了四款专有模型——GPT-4o、GPT-5.2、Claude Sonnet 4.5和DeepSeek——在两个专业领域:地球、环境和行星科学(EEPS)以及自然语言处理(NLP)。实验基于每个领域80个术语,比较了两种提示策略:术语模式和翻译模式。结果突显了模型之间、提示策略之间以及较小程度上领域之间的明显差异。Claude Sonnet 4.5在最有利的配置下取得最佳结果,而DeepSeek则以其更高的稳定性脱颖而出。对置信度估计的分析也表明,它们仅能部分指示术语准确性。总体而言,研究结果表明LLM可以成为专业翻译人员的有用工具,但现阶段尚无法取代专业语料库。因此,本研究为未来在工作和教育背景下研究LLM对专业翻译人员的实际实用价值铺平了道路。
查看缓存全文
缓存时间: 2026/07/29 09:52
# 论大语言模型在专业术语中的应用:语料库的可行替代方案? 来源:https://arxiv.org/abs/2607.24784 查看PDF(https://arxiv.org/pdf/2607.24784) > **摘要:**专业翻译依赖于文献和术语资源的使用,包括语料库。这些资源在术语方面尤为有用。然而,它们的汇编与利用存在诸多局限:需要时间、技术技能以及获取那些难以收集的数据的渠道。本研究探讨了大语言模型(LLM)在多大程度上能够协助专业译者寻找英译法等效词。我们评估了四种专有模型——GPT-4o、GPT-5.2、Claude Sonnet 4.5 和 DeepSeek——在两个专业领域(地球、环境与行星科学(EEPS)和自然语言处理(NLP))中的表现。实验基于每个领域80个术语,比较了两种提示策略:术语模式和翻译模式。结果凸显了模型之间、提示策略之间以及(在较小程度上)领域之间的明显差异。在最优配置下,Claude Sonnet 4.5 取得了最佳结果,而 DeepSeek 则以其更高的稳定性脱颖而出。对置信度估计的分析还表明,它只是术语准确性的部分指标。总体而言,研究结果表明,大语言模型可以成为专业译者的有用工具,但在现阶段尚无法取代专业语料库。因此,本研究为未来在工作与教育环境中探讨大语言模型对专业译者的实际实用价值奠定了基础。 ## 提交历史 来自:Joachim Minder \[查看邮件(https://arxiv.org/show-email/45af6ef9/2607.24784)\] \[经由CCSD代理\] **\[v1\]**2026年6月22日星期一 09:03:13 UTC(931 KB)
相似文章
基于LLM的跨语言手写OCR自动机器学习:利用GPT-5、GPT-4o和Claude Sonnet 4的闭环神经架构搜索
本文提出了一种基于LLM的流水线,利用GPT-5、GPT-4o和Claude Sonnet 4自动设计跨语言手写OCR的神经网络架构,在阿拉伯语、英语和波斯语文本上实现了超过93%的准确率,无需人工干预。
用于生物医学声明验证的小型LLM:经济高效的微调、结构化数据集捷径与跨域泛化
使用QLoRA对小型LLM(3B-7B)进行生物医学声明验证的微调,以44.5倍更低的成本实现了比GPT-4o和GPT-5更高的F1分数,并揭示了SciFact中的一个结构伪影。该研究表明,在结构合理的数据上进行训练可实现稳健的跨域迁移。
DeepSeek LLM:以长期主义扩展开源语言模型
DeepSeek LLM是一个开源语言模型项目,它开发了一个大规模数据集,并采用SFT和DPO,在各种基准测试和开放式评估中实现了超越LLaMA-2 70B和GPT-3.5的性能。
从基准测试到推理能力:大语言模型在越南法律文本上的双维度大规模评估
为大语言模型在越南法律文本简化任务上提出了一个综合的双维度评估框架,结合了定量基准测试(准确性、可读性、一致性)和跨 GPT-4o、Claude 3 Opus、Gemini 1.5 Pro 和 Grok-1 的定性错误分析。
一些好条款:比较LLMs与领域训练的小型语言模型在结构化合同提取中的表现
本文比较了领域训练的小型语言模型(Olava Extract)与前沿LLMs在结构化合同提取中的表现,结果显示该专业化模型获得了更高的F1分数且成本显著降低。