标签
本文介绍了ERGO,一种面向文本分类中迭代提示优化的错误驱动方法,该方法诊断分类失败并生成有针对性的决策规则,在错误集中于特定混淆标签对的任务上取得了最佳准确率。
本文批判了使用成对比较来学习人类偏好的方法,认为内部多元主义(多种相互冲突的优先级)削弱了标准方法。它提出了一个形式化模型,并建议允许犹豫不决可以提高学习效率。
Trace2Policy 从专家行为痕迹中提取人类可读的决策规则,并通过错误驱动的技能精炼进行迭代优化,在物流领域的合规敏感任务上优于纯LLM基线。