教LLM低资源语言:提升Pharo中的代码补全

Hugging Face Daily Papers 论文

摘要

本文介绍了一个端到端的管道,用于将LLM适配到低资源编程语言,以Pharo为案例研究,通过适合实时IDE支持的小型模型实现了卓越的代码补全。

大型语言模型(LLM)为自动代码编写开启了新可能性,成为大多数代码补全工具的支柱。虽然LLM在主流语言上表现出色,但它们往往缺乏对所谓低资源语言的支持,这些语言的训练数据稀缺。因此,这些语言在代码补全工具的质量上落后于其社区可获得的支持。一个具体例子是Pharo,一种受Smalltalk启发的语言,其IDE目前仅提供单令牌补全。在这项工作中,我们报告了将基于LLM的代码补全引入Pharo的经验。首先,我们描述了一个端到端的管道,该管道结合了Pharo特定的数据整理、对开源代码LLM的继续预训练和微调。其次,我们介绍了一组Pharo代码补全基准测试,旨在评估模型(i)是否学习Pharo的语法以及(ii)是否准确补全来自真实世界GitHub仓库的掩码Pharo代码。第三,我们通过实验表明,Pharo专用模型显著优于其原始基础检查点,并且在Pharo补全上的准确性也超过了更大的代码LLM。总体而言,我们的案例研究证明了将强大的基于LLM的代码补全引入低资源编程语言的可行性,所用模型足够小,可以提供“实时”的IDE内支持。
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:50

论文页面 - 教会大型语言模型低资源语言:提升 Pharo 代码补全能力

来源:https://huggingface.co/papers/2607.04939

摘要

通过专用的训练管道和基准测试,大型语言模型可以针对低资源编程语言进行适配,从而在代码补全性能上超越通用型模型。

大型语言模型(Large Language Models, LLMs)为自动化代码编写开辟了新可能,成为大多数代码补全(https://huggingface.co/papers?q=code%20completion)工具的支柱。尽管 LLMs 在主流语言中表现出色,但它们在训练数据稀缺的所谓低资源语言上往往缺乏支持。因此,这些语言在可供其社区使用的代码补全(https://huggingface.co/papers?q=code%20completion)工具质量上落后于主流语言。一个具体的例子是 Pharo,一种受 Smalltalk 启发的语言,其集成开发环境目前仅提供单标记补全。在本工作中,我们报告了将基于 LLM 的代码补全(https://huggingface.co/papers?q=code%20completion)引入 Pharo 的经验。首先,我们描述了一个端到端管道,该管道结合了 Pharo 特有的数据整理、针对开放代码 LLMs 的持续预训练(https://huggingface.co/papers?q=continued%20pre-training)和微调(https://huggingface.co/papers?q=fine-tuning)。其次,我们引入了一套 Pharo 代码补全基准测试(https://huggingface.co/papers?q=code%20completion%20benchmarks),旨在评估模型是否(i)学会了 Pharo 的语法,以及(ii)能够准确补全来自真实世界 GitHub 仓库中被遮蔽的 Pharo 代码。第三,我们通过实验证明,针对 Pharo 特化的模型显著优于其原始基础检查点,并且在 Pharo 补全任务上的准确率甚至超过了规模大得多的代码 LLMs。总体而言,我们的案例研究证明了将强大的基于 LLM 的代码补全(https://huggingface.co/papers?q=code%20completion)引入低资源编程语言的可行性——所使用的模型足够小,能够提供“实时”的 IDE 内支持。

查看 arXiv 页面(https://arxiv.org/abs/2607.04939)查看 PDF(https://arxiv.org/pdf/2607.04939)GitHub0(https://github.com/kilian-kier/pharo-llm-completion)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.04939)

引用本论文的模型0

无模型关联本论文

请在模型 README.md 中引用 arxiv.org/abs/2607.04939,以便在本页面链接它。

引用本论文的数据集0

无数据集关联本论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.04939,以便在本页面链接它。

引用本论文的空间0

无空间关联本论文

请在空间 README.md 中引用 arxiv.org/abs/2607.04939,以便在本页面链接它。

包含本论文的收藏0

无收藏包含本论文

请将本论文添加到一个收藏(https://huggingface.co/new-collection)中,以便在本页面链接它。

相似文章

无需代码的LLM微调

Reddit r/AI_Agents

本文讨论如何让非编程人员也能进行LLM微调,重点展示了一段视频演示,说明任何人都可以在无需编码的情况下定制LLM。

无语义的语法:教会大语言模型用未见过的语言编程

arXiv cs.CL

本文介绍了PyLang,一种在所有预训练语料库中都不存在的编程语言,并表明在其上微调的大语言模型可以学习语法但无法迁移算法推理,导致出现“实现忠实度差距”——模型理解算法但无法用不熟悉的语言表达它们。