立场:自然语言不应完全取代形式语言

arXiv cs.CL 论文

摘要

本文立场论文反驳了自然语言可以完全取代形式语言(如编程语言)的观点,提出了一个基于信息论的特定性框架,并证明了一个交叉定理,表明形式语言在高特定性任务中更具优势。

arXiv:2607.20432v1 公告类型:新 摘要:近期大型语言模型的发展及广泛应用引发了这样的主张:自然语言可以完全取代形式语言,例如用于软件设计的编程语言。在本文中,我们认为这种观点忽略了自然语言的基本语言学特性,具体而言,自然语言是为开放式语境下的欠指定性而优化的。我们引入了一个以*任务特定性*为中心的形式化框架,将其定义为在给定用户特定需求的情况下,输出空间(如所有可能的图像)中不确定性的信息论缩减。我们证明了一个*特定性交叉定理*,表明存在一个阈值,超过该阈值后,将形式化需求用自然语言表达的成本超过了直接形式化规范的成本。通过分析跨模态的案例研究,如图像生成、代码合成和音频制作,我们展示了自然语言在低特定性任务中表现出色,而形式语言在要求更严格的任务中具有优势。我们得出结论:自然语言和形式语言是互补工具,并倡导开发允许用户在特定性谱系中自由切换的混合系统。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:15

# 立场:自然语言不应完全取代形式语言 来源:https://arxiv.org/html/2607.20432 ###### 摘要 大型语言模型的最新进展及其广泛应用,引发了“自然语言可完全取代形式语言(如编程语言)用于软件设计”的说法。在本文中,我们主张这一观点忽略了自然语言的基本语言属性,特别是它专为开放语境下的欠明确性而优化。我们引入了一个以任务特定性为核心的形式框架,将其定义为:给定用户的具体需求,在输出空间(例如所有可能的图像)中信息论意义上的不确定性降低。我们证明了一个“特定性交叉定理”,表明存在一个阈值,超过该阈值后,将形式需求表达为自然语言的成本超过直接进行形式化说明的成本。通过分析图像生成、代码合成和音频制作等跨模态案例研究,我们证明自然语言在低特定性任务中表现优越,而形式语言在要求更严格的任务中更具优势。我们得出结论:自然语言和形式语言是互补的工具,并倡导开发混合系统,使用户能够在特定性光谱上灵活移动。 机器学习、自然语言处理、率失真理论 ## 1引言 大型语言模型(LLMs)正在改变人机交互方式,引发了对专业专长未来走向的质疑。随着这些模型能力不断增强,对专业技能被替代的担忧也日益加剧。编程是一个尤为突出的案例:代码具有经济重要性,运行于定义明确的形式化领域,并受益于丰富的训练数据(Jiang 等,2024(https://arxiv.org/html/2607.20432#bib.bib84);Joel 等,2024(https://arxiv.org/html/2607.20432#bib.bib85))。AI 辅助编程已被广泛采用——Stack Overflow 2025 年调查显示,84%84%的受访者使用了 AI 工具¹¹¹https://survey.stackoverflow.co/2025/ai#sentiment-and-usage,且对采用该技术的态度日益积极(Eshraghian 等,2025(https://arxiv.org/html/2607.20432#bib.bib75))。一些人设想未来自然语言将完全取代编程语言——一种名为“新编程语言就是人类语言”的愿景(Jensen Huang;伦敦科技活动,2025 年 6 月)²²²https://youtu.be/SsNS3Xm9ig4?t=1940。然而,当前系统面临重大局限:难以处理领域特定代码(Joel 等,2024(https://arxiv.org/html/2607.20432#bib.bib85)),难以适应不断变化的需求(Jiang 等,2024(https://arxiv.org/html/2607.20432#bib.bib84)),以及安全性差(Dora 等,2025(https://arxiv.org/html/2607.20432#bib.bib66))。总体而言,报告积极不信任(46%)的开发者多于信任(33%)的开发者³³³https://survey.stackoverflow.co/2025/ai#developer-tools。这些挑战引发了疑问:它们到底是暂时的工程障碍,还是根本性的限制? **我们的立场。** 我们认为自然语言和形式语言(如代码本身)在信息论上扮演互补角色,各自针对我们所谓的“特定性阶梯”——一个基于先前关于自然语言沟通效率与歧义性研究(Gibson 等,2019(https://arxiv.org/html/2607.20432#bib.bib80);Piantadosi 等,2012(https://arxiv.org/html/2607.20432#bib.bib101))所定义的层次结构——上的不同点进行了优化。自然语言通过欠明确性(Roberts,2012(https://arxiv.org/html/2607.20432#bib.bib97))来应对“开放性”——即关于无边界世界进行沟通的挑战,这包括“语用性欠明确性”(听者从语境推断说话者意图)和“漠然性欠明确性”(说话者真正接受多种结果)。形式语言则牺牲了这种灵活性,以在受限领域内进行精确描述,运行于“完全明确”水平,每个相关细节都清晰明确。跨越这些模态之间的成本——“翻译鸿沟”——意味着没有任何一种方法占绝对优势:在低任务特定性下,自然语言通过欠明确性胜出;而在高任务特定性下,形式语言则通过减少错误风险和避免翻译开销而更优。这种互补性表明,研究不仅应关注形式语言生成能力,还应关注有效的人机协作,认识到何时何种模态更为有利。 ### 1.1主要贡献 基于语言学见解(§2(https://arxiv.org/html/2607.20432#S2)),我们提供了一个信息论框架(§3(https://arxiv.org/html/2607.20432#S3)),用于将任务建模为具有显式和隐式约束的约束满足问题,同时沿一个连续谱区分欠明确性的类型。我们证明:对于足够具体的任务——且形式语言的冗余度不过高——自然语言描述的效率低于在目标模态中直接进行形式化说明。我们的分析验证了早期在图像、代码、音频和文本等多种模态(§4(https://arxiv.org/html/2607.20432#S4))研究中观察到的趋势。作为分析的结果(§5(https://arxiv.org/html/2607.20432#S5)),我们主张从自然语言生成代码的开发与评估需要一种混合方法。因此,端到端编码模型和智能体的实际价值也应根据其对工作流的实际益处来评估,并以各种混合模型作为基线,同时涵盖低专业度和高专业度领域。 ## 2 沟通效率:开放性与欠明确性 在本节中,我们将提供关于欠明确性的语言学和信息论背景。在本文的范围内,我们关注一种特定类型的言语行为(Searle,1969(https://arxiv.org/html/2607.20432#bib.bib6)):描述——直接或间接地——一个需要实现的目标。 ### 2.1聚焦沟通 自然语言是人类主要的沟通工具,针对跨不同语境的高效信息传递进行了优化(Zipf,1949(https://arxiv.org/html/2607.20432#bib.bib43))。一个根本挑战是“开放性”:自然语言必须通过生成新话语的能力来处理现实世界几乎无限复杂的特性(Hockett 和 Hockett,1960(https://arxiv.org/html/2607.20432#bib.bib64);Deacon,1998(https://arxiv.org/html/2607.20432#bib.bib42))。由于语言使用者本身也贡献了这种复杂性——创造新概念、文化实践和沟通需求——可能含义的空间本质上是无限的(Tomasello,2009(https://arxiv.org/html/2607.20432#bib.bib41))。 “讨论中的问题”(QUD)框架(Ginzburg 及其合作者,1996(https://arxiv.org/html/2607.20432#bib.bib29);Roberts,2012(https://arxiv.org/html/2607.20432#bib.bib97))通过将话语视为围绕聚焦沟通的隐含问题来应对这一挑战。QUD 决定了世界的哪些方面是相关的,从而允许省略不相关的细节。这种机制使自然语言能够应对开放性:每个言语行为仅明确说明当前沟通目标所需的内容。 ### 2.2特定性阶梯 在给定的领域和 QUD 内,话语在约束可接受含义空间的精确程度上有所不同。放松对可能含义的约束被称为语义欠明确性。在语义学中,多种框架试图通过单个紧凑的元结构来表示句子的“共享”含义(Reyle,1993(https://arxiv.org/html/2607.20432#bib.bib25);Copestake 等,2005(https://arxiv.org/html/2607.20432#bib.bib26))。从认知角度看,这种方法与以下观察一致:人类听者通常对歧义输入保持欠明确的心理表征,只有在语用线索或话语需求提示时才承诺特定的解释(Poesio,1995(https://arxiv.org/html/2607.20432#bib.bib28);Frisson,2009(https://arxiv.org/html/2607.20432#bib.bib27))。 我们通过“特定性阶梯”(参见图1(https://arxiv.org/html/2607.20432#S2.F1))来描述这种变化,这是一个反映所说与所指之间不同关系的层次结构: 参见图表 图1:特定性阶梯:从真正的漠然(顶部)到过度明确(底部),附有相应的压缩收益和错误风险。 ###### 定义 2.1(特定性阶梯)。 沟通通过一个特定性层次实现压缩: 1. 1.过度明确:提供的信息超出严格必要,包括冗余或强调(例如,“一只猫,不是狗”)。虽然看似低效,但冗余可以减少噪声信道中的错误率(Shannon,1948(https://arxiv.org/html/2607.20432#bib.bib46))。即使是表面上精确的话语,如“3点整”,也允许某些隐含的灵活性;添加“精确地”则缩小了可能解释的空间,禁止近似值(Lasersohn,1999(https://arxiv.org/html/2607.20432#bib.bib32))。 2. 2.完全明确:当前领域的每个相关细节都已明确陈述(例如,代码或颜色的精确 RGB 值)。在此级别,意图的描述与其实现基本重合。形式语言通常在其领域内在此级别运行(Meyer,1993(https://arxiv.org/html/2607.20432#bib.bib59))。 3. 3.语用性欠明确:含义预期从语境中推断,说话者具有超出字面表达之外的意图。此级别涵盖几种不同的情况: - •明确意图:说话者心中有一个特定的结果,但依赖共享知识进行消歧(例如,“专业造型”假定标准设计原则)。 - •潜在偏好:说话者最初没有明确偏好,但通过互动和反馈发现自己确实关心某些属性。说话者的约束通常通过试错循环中对其表达目标的迭代细化而浮现。 - •委托:说话者不对某些细节表达明确偏好,信任听者代表自己做出良好选择(例如,经理说“处理部署”,信任工程师的判断)。重要的是,并非所有选择都可以接受;说话者采纳了听者的判断。 4. 4.漠然性欠明确:对输出属性真正漠不关心,多种解释对说话者来说同样可接受(例如,“使用任何合理的配色方案”)。 语用性欠明确与漠然性欠明确之间的关键区别在于:说话者是否对欠明确的属性持有(可能是隐含的)偏好。在语用性欠明确中,沟通失误代表失败;在漠然性欠明确中,变化是设计上可接受的。 形式语言(如编程语言)通过在其受限领域内主要运行于完全明确级别来实现精确性⁴⁴⁴一般来说,形式语言由一组确定性规则定义,包括其语法(即话语)和语义(即话语与对象之间的映射)。特别是,不存在歧义或随机性;一个话语可以表示一组对象,但映射本身不是随机的。值得注意的是,形式语言有时表现出层次抽象:命令 `x = 1 + 2` 精确地指定了存储的值,但没有指定它在物理内存中的位置或处理器如何执行加法。形式语言在结果级别是确定性和无歧义的,同时将实现细节委托给对输出影响可忽略的较低系统层级。 ### 2.3语言学视角 特定性阶梯与语言学和认知科学的几个研究传统相关联。 #### 语用学与推理。 语境如何塑造超越字面语义的意义,是理解语用性欠明确的核心。Grice(1975(https://arxiv.org/html/2607.20432#bib.bib99))建立了合作沟通的基本原则,其中说话者暗示超出字面表达的含义。Levinson(2000(https://arxiv.org/html/2607.20432#bib.bib30))全面阐述了听者如何推断语用意义。Carston(2008(https://arxiv.org/html/2607.20432#bib.bib34))认为实际表达的意义总是比所用的词语丰富得多,听者会填充大量隐含内容。Clark(1996(https://arxiv.org/html/2607.20432#bib.bib35))强调“共同背景”在此推理过程中的作用。理性言语行为(RSA)框架(Frank 和 Goodman,2012(https://arxiv.org/html/2607.20432#bib.bib93);Goodman 和 Frank,2016(https://arxiv.org/html/2607.20432#bib.bib92))将语用推理建模为有界理性推理(Degen,2023(https://arxiv.org/html/2607.20432#bib.bib100)),其中说话者和听者在计算约束下推理可能的解释。 将听者推理形式化的尝试包括逻辑中的默认推理(Reiter,1980(https://arxiv.org/html/2607.20432#bib.bib40);Mercer,1987(https://arxiv.org/html/2607.20432#bib.bib39)),尽管其他人认为自然情境对于形式逻辑来说过于复杂(Cadoli 和 Schaerf,1993(https://arxiv.org/html/2607.20432#bib.bib38)),而概率方法能更好地描述认知过程(Oaksford 和 Chater,2007(https://arxiv.org/html/2607.20432#bib.bib37))。 语用性欠明确引入了沟通失误的风险。正确推断隐含约束的概率取决于约束的性质和共享语境的质量(Ferreira,2008(https://arxiv.org/html/2607.20432#bib.bib103))。至关重要的是,对于成功的语用推理,听者必须理解特定说话者的语境、知识和偏好(Bergen 和 Grodner,2012(https://arxiv.org/html/2607.20432#bib.bib21))。这种个性化质量是对话系统中的一个活跃研究课题(Zadrozny 等,2000(https://arxiv.org/html/2607.20432#bib.bib20);Oruche 等,2025(https://arxiv.org/html/2607.20432#bib.bib19))。 #### 沟通效率。 大量研究通过信息论(Futrell 和 Hahn,2022(https://arxiv.org/html/2607.20432#bib.bib24))的视角,通常借助率失真理论(有损压缩的基础)(Shannon 及其合作者,1959(https://arxiv.org/html/2607.20432#bib.bib45)),来探究沟通效率。一个普遍发现是,语言在简洁性(较短消息)和信息性之间取得了最优平衡(Kemp 和 Regier,2012(https://arxiv.org/html/2607.20432#bib.bib94);Zaslavsky 等,2017(https://arxiv.org/html/2607.20432#bib.bib95);Marzen 和 DeDeo,2017(https://arxiv.org/html/2607.20432#bib.bib96);Gibson 等,2019(https://arxiv.org/html/2607.20432#bib.bib80))。Krifka(2007(https://arxiv.org/html/2607.20432#bib.bib33))指出,说话者在精度不必要时会使用不精确的语言(如近似数字)作为减少努力的手段。Piantadosi 等(2012(https://arxiv.org/html/2607.20432#bib.bib101))证明,当语境能够消歧时,歧义性作为一种压缩机制发挥作用。未完待续...

相似文章

大型语言模型应学习个性化而非聚合的人类偏好

arXiv cs.LG

这篇立场论文主张,大型语言模型应从个性化而非聚合的人类偏好中学习,指出社会选择理论中的理论局限性以及人口多样性带来的实际问题。它提出了有边界的个性化框架,在尊重个体自主性的同时维护普遍的安全约束。

神经坍缩是被禁止的:语言模型中的信息下限

arXiv cs.CL

本文认为,语言模型表示中的类内方差并非不完全的神经坍缩,而是分配的信息存储,且这种分配服从信息下限定律。在14个模型中,宏观类别结构仅承载4–12%的表示方差,而词元内上下文则占据79–91%。

无语义的语法:教会大语言模型用未见过的语言编程

arXiv cs.CL

本文介绍了PyLang,一种在所有预训练语料库中都不存在的编程语言,并表明在其上微调的大语言模型可以学习语法但无法迁移算法推理,导致出现“实现忠实度差距”——模型理解算法但无法用不熟悉的语言表达它们。