从文字到控件:实现可控的LLM生成
摘要
可塑提示(Malleable Prompting)是一种新颖的交互技术,它将自然语言偏好具体化为GUI控件(滑块、开关、下拉菜单)以供直接操作,并配有解码算法,该算法根据控件值调节词元概率,从而实现对LLM生成的精确控制。一项用户研究表明,在精确性、可控性和透明度方面,它优于纯自然语言提示。
arXiv:2604.10925v2 公告类型:交叉
摘要:自然语言仍然是人们与大型语言模型(LLM)交互的主要方式。然而,用户往往难以通过提示精确表达和控制主观偏好(例如语气、风格和重点)。我们提出了可塑提示(Malleable Prompting),这是一种用于可控LLM生成的新型交互式提示技术。它将自然语言提示中的偏好表达具体化为GUI控件(例如滑块、下拉菜单和开关),用户可以直接配置这些控件来引导生成,同时可视化每个控件对输出的影响,以支持跨迭代的归因和比较。为了实现这种交互,我们引入了一种LLM解码算法,该算法在生成过程中根据偏好表达式及其控件值调整词元概率分布。通过一项用户研究,我们表明可塑提示帮助参与者更精确地达到目标偏好,并且被认为比单独使用自然语言提示更具可控性和透明度。
查看缓存全文
缓存时间: 2026/07/15 04:23
# 从文字到控件:可控大语言模型生成 来源: https://arxiv.org/html/2604.10925 \(2026\) ###### 摘要。自然语言仍然是人们与大型语言模型(LLM)交互的主要方式。然而,用户通常难以通过提示精确表达和控制主观偏好(例如语气、风格和重点)。我们提出**可塑提示**,这是一种用于可控LLM生成的新型交互式提示技术。它将自然语言提示中的偏好表达具象化为GUI控件(例如滑块、下拉菜单和开关),用户可以直接配置这些控件来引导生成,同时可视化每个控件对输出的影响,以支持跨迭代的归因和比较。为了实现这种交互,我们引入了一种LLM解码算法,该算法在生成过程中根据偏好表达及其控件值调整token概率分布。通过一项用户研究,我们表明**可塑提示**帮助参与者更精确地实现目标偏好,并且相比纯自然语言提示,被认为更具可控性和透明性。 提示, 大型语言模型, 人机交互 ††submissionid:1266 ††journalyear:2026 ††copyright:cc ††conference:第39届ACM用户界面软件与技术年度研讨会; 2026年11月02–05日; 美国密歇根州底特律 ††booktitle:第39届ACM用户界面软件与技术年度研讨会 (UIST '26), 2026年11月02–05日, 美国密歇根州底特律 ††doi:10.1145/3830398.3830587 ††isbn:979-8-4007-2856-3/2026/11 ††ccs:以人为中心的计算 → 自然语言界面 ††ccs:计算方法 → 自然语言处理 参见图1。**可塑提示**。 不同于通过未充分指定的自然语言提示反复修改输出(左图),**可塑提示**让用户将提示偏好具象化为GUI控件,并直接操作它们来引导生成(A)[原文标注,保留链接]。将鼠标悬停在控件上会显示受该偏好影响的输出片段,使单个效果可检查(B)。 [此处是描述两部分的预览图,左侧“自然语言提示”展示用户多次修改请求的聊天记录,右侧“可塑提示”展示结合GUI控件的交互界面。英文描述省略翻译,保留关键术语。] ## 1. 引言 在与大型语言模型(LLM)交互时,用户通过提示提供指令,但模型很少能在第一次尝试时就完全符合用户意图。因此,用户经常参与迭代过程 (Mysore et al., 2025 (https://arxiv.org/html/2604.10925#bib.bib9)),通过逐轮对话调整模型输出,以更好地匹配其偏好。例如,用户可能要求模型起草一篇比较两款手机的博客文章,然后通过指定比较方面(如价格、电池、美学)、改变结构(项目符号 vs. 叙事)以及微调风格(如“更简洁”、“更少正式”)来进行迭代。虽然先前的工作通过直接操作帮助用户修改生成文本的具体方面,例如用同义词替换单词 (Masson et al., 2024 (https://arxiv.org/html/2604.10925#bib.bib26)),但用户仍然难以仅通过提示来阐明和控制更**主观的偏好**——如语气、风格和重点 (Li et al., 2023 (https://arxiv.org/html/2604.10925#bib.bib65); Subramonyam et al., 2024 (https://arxiv.org/html/2604.10925#bib.bib64))。这一挑战源于自然语言提示中的两个交互鸿沟: - • 首先,存在**执行鸿沟** (Hutchins et al., 1985 (https://arxiv.org/html/2604.10925#bib.bib10)):用户最初可能没有清晰的偏好,用语言表达微妙的偏好极其困难 (Zamfirescu-Pereira et al., 2023 (https://arxiv.org/html/2604.10925#bib.bib12))。即使用户有偏好,也难以使模型输出符合他们对偏好表达程度的预期,只能依赖模糊的修饰词(“更简洁”、“不是那么简洁”)来传达细微调整。 - • 其次,存在**评估鸿沟** (Norman, 1986 (https://arxiv.org/html/2604.10925#bib.bib11)):随着偏好在多轮对话中累积,线性的聊天历史变得冗长且难以导航。用户难以比较迭代版本或将输出差异归因于特定指令,因此难以决定下一步做什么 (Gero et al., 2024 (https://arxiv.org/html/2604.10925#bib.bib13); Zhang et al., 2025a (https://arxiv.org/html/2604.10925#bib.bib14))。 图形用户界面 (Hutchins et al., 1986 (https://arxiv.org/html/2604.10925#bib.bib47)) 长期以来通过将用户目标转化为可控控件(如下拉菜单、开关和滑块)来帮助减少交互鸿沟。在人机LLM交互中,先前的工作已使用控件使提示更具结构化和可复用性 (MacNeil et al., 2023 (https://arxiv.org/html/2604.10925#bib.bib37); Amin et al., 2025b (https://arxiv.org/html/2604.10925#bib.bib30); Wang et al., 2024 (https://arxiv.org/html/2604.10925#bib.bib66); He et al., 2025 (https://arxiv.org/html/2604.10925#bib.bib16))。然而,这些系统通常只允许用户调整预定义的维度,例如使用滑块调整特定属性的强度 (Bo et al., 2025 (https://arxiv.org/html/2604.10925#bib.bib1)),并且对检查特定控件如何影响生成输出的支持有限。 在本文中,我们引入了一种更灵活、更透明的交互技术,通过结合GUI控件的可控性与自然语言调整的灵活性,共同缓解偏好控制中的这两个鸿沟(图1 (https://arxiv.org/html/2604.10925#S0.F1))。具体来说,我们做出以下贡献: 1. (1) 我们提出**可塑提示**(§3 (https://arxiv.org/html/2604.10925#S3)),一种新颖的交互技术,允许用户将提示中的任意偏好表达具象化为多种GUI控件(例如开关、下拉菜单、步进器和滑块)。通过**可塑提示**,用户可以通过控件直接操作提示中的偏好以控制生成(解决执行鸿沟),并检查每个偏好/控件如何塑造输出(解决评估鸿沟)。 2. (2) 我们构建了一个示例系统(§4 (https://arxiv.org/html/2604.10925#S4)),实现了**可塑提示**。该系统自动检测并将提示中的偏好表达转换为GUI控件,使用户能够配置这些控件来引导生成,通过高亮检查它们对输出的影响,并通过节点链接图跟踪迭代及其对应的控件配置。 3. (3) 我们引入了一种新的LLM解码算法,以支持**可塑提示**(§5 (https://arxiv.org/html/2604.10925#S5))。这种技术方法将提示模块化为可控属性,实现对特定偏好的独立控制以引导模型生成,并将生成的文本片段归因于相应的控件。 4. (4) 我们进行了一项用户研究(§6 (https://arxiv.org/html/2604.10925#S6)),在受控的迭代内容创作任务(N=12)中,将我们的方法与纯自然语言提示进行比较。结果表明,我们的方法帮助用户更精确地实现目标偏好,并且用户认为它更具可控性和透明性。在§7 (https://arxiv.org/html/2604.10925#S7)中,我们讨论了**可塑提示**如何解决这两个鸿沟,并探讨了其超越本文示例系统的更广泛应用。 ## 2. 背景与相关工作 ### 2.1. 迭代提示中的挑战 提示具有表达力:用户可以用日常语言描述目标、约束和偏好,使LLM易于用于开放式写作任务。然而,自然语言也是一种模糊的交互媒介 (Gao et al., 2015 (https://arxiv.org/html/2604.10925#bib.bib25); Feng et al., 2024 (https://arxiv.org/html/2604.10925#bib.bib33); Ma et al., 2025 (https://arxiv.org/html/2604.10925#bib.bib20); Manam et al., 2022 (https://arxiv.org/html/2604.10925#bib.bib21))。由于许多意图和偏好缺乏明确说明、主观或依赖上下文,用户常常难以让模型可靠地解释他们所表达的意思 (Zamfirescu-Pereira et al., 2023 (https://arxiv.org/html/2604.10925#bib.bib12)),尤其是在语气和风格等细微偏好方面。因此,用户往往需要通过反复试错来校准提示以逼近预期目标 (Mysore et al., 2025 (https://arxiv.org/html/2604.10925#bib.bib9))。 这些困难因LLM交互中常见的逐轮对话界面而加剧。迭代提示将偏好分散到多个消息中,导致跨草稿的归因困难 (Gero et al., 2024 (https://arxiv.org/html/2604.10925#bib.bib13); Zhang et al., 2025a (https://arxiv.org/html/2604.10925#bib.bib14); Laban et al., 2025 (https://arxiv.org/html/2604.10925#bib.bib53)),即使有对话历史 (Gero et al., 2024 (https://arxiv.org/html/2604.10925#bib.bib13)),也因缺乏可复用性而难以处理。 为了缓解这些挑战,先前的工作设计了各种工具来帮助用户在提示调优过程中。一类工作自动建议有效的提示,或从反馈或示例中直接优化用户提示 (Habba et al., 2025 (https://arxiv.org/html/2604.10925#bib.bib35); Brade et al., 2023 (https://arxiv.org/html/2604.10925#bib.bib31); Li et al., 2026 (https://arxiv.org/html/2604.10925#bib.bib36))。其他工作构建了用于提示开发的视觉环境,例如支持系统实验的提示IDE(如组织变体、运行批处理、比较输出) (Arawjo et al., 2024 (https://arxiv.org/html/2604.10925#bib.bib42); Kim et al., 2024 (https://arxiv.org/html/2604.10925#bib.bib41); Strobelt et al., 2022 (https://arxiv.org/html/2604.10925#bib.bib44); Mishra et al., 2025 (https://arxiv.org/html/2604.10925#bib.bib43)),以及帮助用户组合多步LLM工作流并检查中间结果的视觉编程界面 (Wu et al., 2022b (https://arxiv.org/html/2604.10925#bib.bib39); Zhang et al., 2023 (https://arxiv.org/html/2604.10925#bib.bib28); Wu et al., 2022a (https://arxiv.org/html/2604.10925#bib.bib40))。总的来说,这些系统增强了自然语言提示的**工程**方面,但它们通常仍将用户偏好视为自由形式的文本,必须反复重新指定并由模型解释。 鉴于过去的研究,保留NL提示灵活性的同时让用户控制偏好如何应用,这激发了我们的工作。更具体地说,我们关注**可控性**:我们支持对提示中表达的**主观维度**进行探索、调整和归因,使用户偏好可以直接操作,其效果可检查。 ### 2.2. 融合语言与直接操作 除了纯自然语言提示,先前的工作还探索了混合界面,将自然语言指令与直接操作或类GUI控件相结合。许多此类系统使用按钮、标签或其他控件来执行预定义提示、打包可复用指令 (Gmeiner et al., 2025 (https://arxiv.org/html/2604.10925#bib.bib34); Riche et al., 2025 (https://arxiv.org/html/2604.10925#bib.bib38)),或填充提示模板 (MacNeil et al., 2023 (https://arxiv.org/html/2604.10925#bib.bib37))。例如,PromptCanvas (Amin et al., 2025b (https://arxiv.org/html/2604.10925#bib.bib30)) 使用户能够组合并复用提示片段(如故事元素)来创建用于文本重写的新提示。DirectGPT 将用户对生成文本的直接编辑编译为提示操作 (Masson et al., 2024 (https://arxiv.org/html/2604.10925#bib.bib26)),用于文本重写。这些系统主要使用控件在生成前组织、复用或组装提示文本。它们通常不支持在生成过程中引导语义偏好,也不揭示特定控制如何影响最终输出。 较小一部分工作将控件用作交互式控制来引导生成模型。在图像生成中,PromptCharm (Wang et al., 2024 (https://arxiv.org/html/2604.10925#bib.bib66)) 支持基于注意力的操作,对数据库定义的修饰词集合进行操纵,而 AdaptiveSliders (Jain et al., 2025 (https://arxiv.org/html/2604.10925#bib.bib2)) 使用预训练的LoRA模块提供可调整的视觉属性。在文本生成中,Steerable Chatbots (Bo et al., 2025 (https://arxiv.org/html/2604.10925#bib.bib1)) 通过预训练引导向量提供一组预定义的对立维度(如预算/豪华、儿童/成人)。这些系统共同展示了将语言与直接操作相结合的价值。**可塑提示**扩展了这一方向,支持更灵活的偏好控制,并增加了在先前文本生成系统中关注有限的评估组件。具体来说,不是将交互限制在开发者、数据库或预训练模块预定义的维度上,**可塑提示**允许用户将提示中任意、上下文特定的偏好表达转化为多样化的可操作控件。它还提供片段级别的归因,揭示每个控件如何影响生成文本的特定部分。这种灵活且可检查的交互是通过一种新的、无需训练的解码时引导方法实现的,而不是需要预训练的LoRA模块或引导向量。我们在表1中总结了**可塑提示**与最相关系统之间的这些区别。 表1. **可塑提示**与结合提示和直接操作的最相关系统的比较。**可塑提示**(我们的)支持对任意用户定义的偏好片段进行无需训练的引导,并通过片段级归因揭示每个控件的影响。
相似文章
PromptPrint:通过自然语言提示在大语言模型中实现行为生物特征识别
介绍PromptPrint,一项系统性研究,表明用户在LLM提示中的习惯性词汇和句法构成可学习的行为生物特征,词汇特征优于语义编码器,并揭示了独特性-一致性悖论。
提示复杂性:大型语言模型中文本与行为的最短提示
本文正式定义了提示复杂性这一概念,该概念衡量固定语言模型生成目标文本或行为所需的最短合理提示,类比于资源有界的柯尔莫哥洛夫复杂性。
面向比较图的可靠LLM评估的提示扰动
提出了一种提示扰动框架,该框架生成扰动的提示变体,通过图级一致性检查过滤掉结构不一致的比较模式,然后应用标准排名方法产生更可靠的LLM排名。
通过风格引导提示解释风格表示
本文提出了一个通过使用风格引导提示(即自然语言指令,引导大语言模型生成具有特定风格属性的文本)来解读风格表示的框架。该方法在描述和模仿写作风格方面均优于基线大语言模型提示技术。
像对我五岁小孩一样解释或任意难度:评估语言模型响应的交互潜力
本文提出一个框架,用于评估LLM在科学查询中生成不同语言复杂度的多个响应的能力。研究发现,模型常常不一致地变化复杂度,表现最好的Claude Sonnet 4.5仅能在46%的情况下正确调整复杂度。