test-time-steering

标签

Cards List
#test-time-steering

风险链条:大型推理模型中的安全失效及通过自适应多原则引导进行缓解

arXiv cs.AI · 2026-05-08 缓存

本文研究了大型推理模型中的安全失效问题,即尽管最终答案安全,但推理轨迹中仍会出现有害内容,并提出了一种自适应多原则引导方法来缓解这些风险。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈