BitTide
首页
最新
模型
工具
新闻
产品
论文
事件
今日日报
搜索
订阅
English
登录
test-time-steering
标签
Cards
List
#test-time-steering
风险链条:大型推理模型中的安全失效及通过自适应多原则引导进行缓解
arXiv cs.AI
↗
· 2026-05-08
缓存
本文研究了大型推理模型中的安全失效问题,即尽管最终答案安全,但推理轨迹中仍会出现有害内容,并提出了一种自适应多原则引导方法来缓解这些风险。
0 人收藏
0 人点赞
← 返回首页
意见反馈
×
提交意见反馈
感谢您的反馈!
提交