LLMs奖励专业知识

Hacker News Top 新闻

摘要

文章认为,领域专业知识是有效使用LLM的最重要技能,并以陶哲轩的ChatGPT对话作为专家级提示词的示例。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/03 22:35

# LLM 奖励专业知识 来源:https://www.seangoedecke.com/llms-reward-expertise/ 在2010年代,如果你有技术短板(比如不会写 CSS),你只能依靠技术纯熟的同事,或者指望网上恰好有你那个问题的答案。如今,每个人都可以把任务交给 LLM,写出还算可以的 CSS。LLM 让每个人都变成了通才。 因此,许多人认为使用 LLM 没有什么技巧可言。如果你想要 LLM 能交付的东西——博士级别的数学、相当不错但偶尔缺乏品味的代码,或者别扭的领英式写作——你直接提出要求即可。既然每个人都在与相同的模型对话,“熟练的提示者”和初次接触 LLM 的人得到的结果是一样的。 这种看法是错误的。**提示(prompting)中最关键的技能,是你所提示领域里的专业知识。** 一个很好的例子是[陶哲轩](https://en.wikipedia.org/wiki/Terence_Tao)与 [ChatGPT](https://chatgpt.com/share/6a5fdc7a-d6f8-83e8-bbea-8deb42cfed56) 关于最近发现的雅可比猜想反例的对话。这和我平时对话的 ChatGPT 不是同一个!即使有挥霍不尽的 token,我也达不到陶哲轩那样的水平。 从陶哲轩的对话中可以学到很多关于如何做好提示的方法。以下是一些观察: - 陶哲轩的消息非常简短且切中要点。他不会逐点回应模型,而是抓住主旨 - 模型的输出比我与 GPT-5.6 Sol 讨论数学时简洁得多。通过展现自己的专业水平,陶哲轩将模型切换到了“与数学家交谈”模式,而不是“向业余人士解释”模式 - 当模型的回应看起来不对时,陶哲轩会提出异议,但他不会直接反驳;相反,他会说“这看起来比我预想的要复杂” - 陶哲轩自己会做出一些跳跃式推断并提出建议。他几乎从不采纳模型关于下一步怎么走的建议 然而,仅仅照搬这些技巧,你无法像陶哲轩那样在数学问题上进行提示。他技巧的关键在于真正理解数学:从 ChatGPT 长达数段的回复中提取相关核心思想,提出替代方法或表述,并识别出“看起来不对劲”之处。 陶哲轩作为数学家,比作为程序员的我要优秀。但这里的观点——**领域知识能让你更好地使用 LLM**——也是我在自己工作中切身感受到的。如果你对自己代码库有良好的理论理解,你就能比对其毫无概念时*更强力地*推动 LLM。因为你自己清楚一个好的解决方案应该是什么样,你可以说“不,我觉得这里可以更简单”,或者“但我们不是已经做了 X 吗?”,或者“我们能用这些熟悉的术语来表达这个问题吗?” 这触及了我之前写过的一个观点:系统设计问题是由具体细节决定的,而不是由通用原则决定的。当然两者都有用,但我宁愿对代码库很熟悉,也不愿对软件系统有深度的通用理解。在他的对话里,陶哲轩问了许多具体问题,比如“X 在这里行得通吗?”或者“给定 Y 和 Z,为什么是 A?”我无法就雅可比猜想提出这些问题,但我可以对我自己在 GitHub 负责的系统提出这些问题。 如果你没有领域知识,你可以紧紧抓住 LLM,至少得到*一些东西*。这并不坏!但如果你有领域知识,你就能通过大力把 LLM 引向你想要的方向,从同一个 LLM 中榨取出多得多的价值。我们大多数人将不得不混合使用这两种方法,因为我们在某些领域有专业知识,在其他领域没有。 领域知识的有用性表明,即使模型变得更强,人类

相似文章

我与LLM共事的经验

Reddit r/ArtificialInteligence

一位具有编码背景的VP/PM分享了使用Claude Opus和Fable等LLM的实践经验,重点指出了模型在记忆、幻觉和原创性方面的局限,同时强调了人类直觉和领域专业知识不可替代的价值。

LLM-as-a-Coach: 面向非可验证任务的体验式学习

Hugging Face Daily Papers

本文介绍了体验式学习(EL)方法,该方法将LLM-as-a-Judge重新用于LLM-as-a-Coach,以提供丰富的文本反馈而非标量奖励,从而提升在开放式非可验证任务上的表现和泛化能力。

LLMs 现在变得复杂了

Hacker News Top

文章讨论了LLMs如何变得越来越复杂,从简单的Transformer堆栈演变为融入多种注意力变体、混合专家模型和多模态编码器,与推荐系统进行了类比,并强调了像FlexAttention这样可组合内核优化的必要性。