标签
本文讨论了一种调试AI智能体的方法,即先识别智能体架构中产生错误答案的具体层,而不是立即调整提示词。
本文系统性地研究了LLM的RL后训练中每层的贡献,发现仅训练单个中间Transformer层即可恢复甚至超越全参数RL的性能提升,且在不同模型和任务上呈现一致模式。