为什么“语气”有效(原因并非你想的那样)
摘要
一篇 2026 年的博客文章重新审视了提示语气和上下文深度如何改变大模型回答,发现带有玩家风格的丰富提示比光秃秃的问题更能获得有数据支撑的深入答案。
暂无内容
查看缓存全文
缓存时间: 2026/04/21 14:44
# 为什么语气有效(原因并非你想的那样)
现在是 2026 年 3 月,是时候重新审视我两年前讨论过的话题:提示语气会直接影响模型给出的内容。过去两年变化巨大,我觉得有必要更新一下观察。
现代大模型已经非常擅长“语码转换”,而且它们知道自己正在这么做。于是,那些看起来过于“梗”的提问,往往能得到既正确又自带“半破墙”彩蛋的回答。模型现在可以把语调切换当成答案的一部分,而不再只是全程用那套黑话回应——这本身很有趣,却也更难拿来当反面教材。
我还得强调:一名熟练的提示工程师,最好对所在领域有起码了解,才能更快发现模型翻车。
---
此外,更丰富的上下文会鼓励模型“挖得更深”(也就是想得更久),从而给出更贴切的答案。下面用两个“游戏里玩哪个角色最强”的例子做演示。
第一个提示简单粗暴:“Overwatch 玩谁最厉害?”模型 10 秒就给出万金油答案。
ChatGPT 对基础提示“Overwatch 玩谁最厉害?”的回应——模型思考 10 秒后,按当前胜率推荐 Junker Queen(坦)、Reaper(输出)、Zenyatta(辅助)。
示例:基础提示对话截图。
当提问换成老玩家语气,答案立刻细腻得多,还附带数据支撑。
ChatGPT 对详细提示“在高 ELO 当前 meta 里,Overwatch 哪个角色最可行?”的回应——模型思考 27 秒,交叉验证实时数据与高段位榜单,最终推荐 Domina,胜率 51.2%,选取率 25.8%。
示例:详细提示对话截图。
如今,面对那些“看似常见却需要深度回答”的问题,把能给的上下文一次性塞进去,往往比事后追问更高效。再把细节与语气结合,经常能把回答质量抬升一个档次。
当然也别走极端。上下文如果过于小众,训练语料里样本太少,模型要么直接认错,要么就开始一本正经地胡编乱造。
祝你提示愉快。
相似文章
注意你的语气:语气会影响LLM的性能吗?
本文探讨了提示语中语气变化对LLM在多选题上准确性的影响,发现存在系统性但因模型而异的效果。研究使用多种模型和数据集证明,语气可能显著改变性能,并提醒用户不要假定LLM对语气具有鲁棒性。
话题作为社会人口特征的代理:对话上下文如何影响大语言模型回答
本文研究了大语言模型如何因对话上下文而产生不同结果,发现话题而非明确的用户人口特征是导致高风险场景(如薪资建议)中差异的主要驱动因素。
理解大型语言模型中与语气相关的推理成本
本文研究了提示语气如何影响大型语言模型的准确性和推理成本(输出令牌消耗),发现不同语气下输出令牌长度差异高达44.3%,而准确性变化较小,并确定了不同模型的最优语气。
关键词至关重要:揭示端侧大语言模型提示词的能量敏感性
本文通过实验研究提示词表述如何影响端侧大语言模型的能耗,表明关键词选择会显著影响解码长度和总能耗,并提示工程可作为轻量级能耗优化手段。
角色提示何时真正有帮助?关于LLM中专家角色注入的检索与度量分析
本文分析了角色提示何时能提升LLM回答的质量,发现它会增加专业深度但降低清晰度,其有效性因领域和问题类型而异。研究引入了用于角色选择的混合检索方法,并提倡采用多指标评估。