标签
本文提出了SAKIKO——一个机制化审计框架,揭示了工具使用型大语言模型中的激活引导干预可能只是将概率质量重新分配,而非真正修复问题;研究发现,其中一个净增益为+55的干预,会破坏其所触及的基准正确决策中超过一半的案例。