@jakevin7: 分享一个神级review提示词方法论。 LLM 自我纠正的综述 《When Can LLMs Actually Correct Their Own Mistakes?》结论是:如果没有测试结果、工具输出等可靠的外部反馈,模型仅靠自己反思,…
摘要
分享了一个基于LLM自我纠正研究的提示词方法论,强调无外部反馈时模型自查效果有限,推荐对抗式审查等逐步增强的提示策略。
查看缓存全文
缓存时间: 2026/08/06 12:42
分享一个神级review提示词方法论。
LLM 自我纠正的综述 《When Can LLMs Actually Correct Their Own Mistakes?》结论是:如果没有测试结果、工具输出等可靠的外部反馈,模型仅靠自己反思,通常很难稳定纠正错误。 也就是说简单的“让模型检查自己”效果一般很有限。
下面三种提示效果往往逐级递增: ●“Review 一下。” ●“进行对抗式审查。” ●“重点检查 XX 易错面,对抗式审查。”
本质上是人作为指导者,要给Agent提供 额外信息 + 方法论。对抗式审查是Review的方法论 + XX 易错面是额外信息。 这些都能让 Agent 获得新的注意力方向和额外计算预算。
相似文章
Reflection or Re-Generation? Why LLM Revision Fails Where Human Revision Succeeds
This paper introduces the Human–LLM Reflection Framework (HRF) to compare human and LLM revision behavior, finding that LLM reflection often yields zero or negative information gain and behaves more like conditioned re-generation than genuine error-driven revision.
Position: It's Time to Optimize LLMs for Self-Consistency
This position paper argues that many LLM failures stem from evaluating outputs independently and proposes a self-consistency framework that treats diverse techniques as special cases of consistency optimization.
独立研究:单个LLM会遗漏多模型面板捕获的约一半代码审查缺陷。欢迎反馈并寻求arXiv认可。
一位独立研究人员的研究发现,单个LLM会遗漏约一半的代码审查缺陷,而使用来自不同提供商的多个模型可显著提高覆盖率,其中添加第二个模型的收益最大。该论文寻求反馈和arXiv认可。
LLMs知道自己何时出错。我对Anthropic的新“全局工作空间”论文进行了一项修复 [R]
作者提出了一种方法,通过使用中间层状态的线性探测器和一个小型训练桥接器将置信度对数进行校准,使LLMs能够表达校准后的置信度,仅需200个标注样本,无需修改权重。这与Anthropic的全局工作空间论文相关,该论文解释了“知道-说出”差距。
相同问题,不同答案:超越准确性评估LLM的可靠性
本文研究了LLM在保持意义不变的改写下答案的变化,发现实例级行为不稳定(翻转率>23%),单提示准确性掩盖了显著的不一致性,而自我改写策略可以部分恢复潜在知识。