alignmment

标签

Cards List
#alignmment

DataRx:面向更安全的大语言模型任务特定微调的缺失感知采样方法

arXiv cs.CL · 2026-08-06 缓存

本文提出了DataRx,一种缺失感知的采样方法,用于在任务特定微调期间选择安全关键的示例以保持大语言模型的安全性,在Llama3-8B-Instruct上将攻击成功率从59.23%降低到13.70%。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈