教LLM低资源语言:提升Pharo中的代码补全
摘要
本文介绍了一个端到端的管道,用于将LLM适配到低资源编程语言,以Pharo为案例研究,通过适合实时IDE支持的小型模型实现了卓越的代码补全。
查看缓存全文
缓存时间: 2026/07/09 07:50
论文页面 - 教会大型语言模型低资源语言:提升 Pharo 代码补全能力
来源:https://huggingface.co/papers/2607.04939
摘要
通过专用的训练管道和基准测试,大型语言模型可以针对低资源编程语言进行适配,从而在代码补全性能上超越通用型模型。
大型语言模型(Large Language Models, LLMs)为自动化代码编写开辟了新可能,成为大多数代码补全(https://huggingface.co/papers?q=code%20completion)工具的支柱。尽管 LLMs 在主流语言中表现出色,但它们在训练数据稀缺的所谓低资源语言上往往缺乏支持。因此,这些语言在可供其社区使用的代码补全(https://huggingface.co/papers?q=code%20completion)工具质量上落后于主流语言。一个具体的例子是 Pharo,一种受 Smalltalk 启发的语言,其集成开发环境目前仅提供单标记补全。在本工作中,我们报告了将基于 LLM 的代码补全(https://huggingface.co/papers?q=code%20completion)引入 Pharo 的经验。首先,我们描述了一个端到端管道,该管道结合了 Pharo 特有的数据整理、针对开放代码 LLMs 的持续预训练(https://huggingface.co/papers?q=continued%20pre-training)和微调(https://huggingface.co/papers?q=fine-tuning)。其次,我们引入了一套 Pharo 代码补全基准测试(https://huggingface.co/papers?q=code%20completion%20benchmarks),旨在评估模型是否(i)学会了 Pharo 的语法,以及(ii)能够准确补全来自真实世界 GitHub 仓库中被遮蔽的 Pharo 代码。第三,我们通过实验证明,针对 Pharo 特化的模型显著优于其原始基础检查点,并且在 Pharo 补全任务上的准确率甚至超过了规模大得多的代码 LLMs。总体而言,我们的案例研究证明了将强大的基于 LLM 的代码补全(https://huggingface.co/papers?q=code%20completion)引入低资源编程语言的可行性——所使用的模型足够小,能够提供“实时”的 IDE 内支持。
查看 arXiv 页面(https://arxiv.org/abs/2607.04939)查看 PDF(https://arxiv.org/pdf/2607.04939)GitHub0(https://github.com/kilian-kier/pharo-llm-completion)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.04939)
引用本论文的模型0
无模型关联本论文
请在模型 README.md 中引用 arxiv.org/abs/2607.04939,以便在本页面链接它。
引用本论文的数据集0
无数据集关联本论文
请在数据集 README.md 中引用 arxiv.org/abs/2607.04939,以便在本页面链接它。
引用本论文的空间0
无空间关联本论文
请在空间 README.md 中引用 arxiv.org/abs/2607.04939,以便在本页面链接它。
包含本论文的收藏0
无收藏包含本论文
请将本论文添加到一个收藏(https://huggingface.co/new-collection)中,以便在本页面链接它。
相似文章
实际环境中的多语言多模态大语言模型:面向低资源语言的构建
本教程论文概述了如何为低资源语言构建多语言多模态大语言模型,涵盖数据创建、模型对齐、微调和评估,重点提供实用方案和动手资源。
无需代码的LLM微调
本文讨论如何让非编程人员也能进行LLM微调,重点展示了一段视频演示,说明任何人都可以在无需编码的情况下定制LLM。
HPC-LLM:面向HPC支持的实用领域自适应与检索增强生成
本文介绍了HPC-LLM,一个面向HPC工作流的检索增强与领域自适应助手,基于HPC文档使用QLoRA微调Llama 3.1 8B模型。实验表明,该模型在资源需求显著降低的情况下,性能与更大的通用模型相当。
无资源,无基准,没问题?评估与改进针对无资源语言的代码生成LLMs
本文通过构建基准测试并提出一种方法,将进一步预训练与权重差异迁移相结合,以更低的成本创建专门的指令遵循模型,从而解决无资源编程语言的代码生成问题。
无语义的语法:教会大语言模型用未见过的语言编程
本文介绍了PyLang,一种在所有预训练语料库中都不存在的编程语言,并表明在其上微调的大语言模型可以学习语法但无法迁移算法推理,导致出现“实现忠实度差距”——模型理解算法但无法用不熟悉的语言表达它们。