representation-repair

标签

Cards List
#representation-repair

纠正何时才算修复?工具使用型大语言模型内部干预的机制化审计

arXiv cs.CL ↗ · 昨天 缓存

本文提出了SAKIKO——一个机制化审计框架,揭示了工具使用型大语言模型中的激活引导干预可能只是将概率质量重新分配,而非真正修复问题;研究发现,其中一个净增益为+55的干预,会破坏其所触及的基准正确决策中超过一半的案例。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈