post-hoc

标签

Cards List
#post-hoc

诱骗方向优化:针对LLM消融攻击的后置防御

arXiv cs.LG ↗ · 2026-09-16 缓存

诱骗方向优化 (DDO) 是一种快速、后置的防御方法,通过向网络注入诱骗信号,保护开放权重的LLM免受拒绝特征消融攻击,在比训练防御更低的成本下实现高鲁棒性。

0 人收藏 0 人点赞
#post-hoc

FALCON-Discover:发现校准中的集中假置信区域

arXiv cs.LG ↗ · 2026-07-22 缓存

本文介绍了FALCON-Discover,这是一个事后(post-hoc)框架,用于发现模型预测高置信度但错误的区域,将校准重点从总体指标转向样本级的危险故障。

0 人收藏 0 人点赞
#post-hoc

SAGE:保留感知的后处理清洗最终遗忘向量

arXiv cs.LG ↗ · 2026-06-18 缓存

提出SAGE,一种后处理方法,用于清洗大型语言模型中的最终遗忘向量,在不重新运行遗忘流程的情况下改善保留-遗忘权衡。

0 人收藏 0 人点赞
#post-hoc

几何感知的神经算子事后不确定性量化

arXiv cs.LG ↗ · 2026-06-17 缓存

提出REEF-GP,一种事后不确定性量化框架,通过将高斯过程拟合到冻结神经算子的残差上并利用其内部嵌入,以低成本实现几何感知且校准的不确定性。

0 人收藏 0 人点赞
#post-hoc

尾巴中的捷径:通过微调更新的后验谱压缩进行去偏

arXiv cs.LG ↗ · 2026-06-09 缓存

一种后验方法通过截断权重更新矩阵SVD的尾部来减少微调大语言模型中的虚假相关性。该方法在不重新训练或使用群体标签的情况下,将虚假群体差距最多减少5倍,精度损失小于2个百分点。

0 人收藏 0 人点赞
#post-hoc

Phase Marginalization: 解决Vision Transformers中补丁网格不稳定性

Hugging Face Daily Papers ↗ · 2026-06-06 缓存

Phase Marginalization是一种事后方法,通过评估结构化补丁网格相位并聚合输出来解决Vision Transformers中依赖于相位的不稳定性。与标准基线相比,它以最小的额外成本改善了分割、深度和局部匹配性能。

0 人收藏 0 人点赞
#post-hoc

CSULoRA: 最接近安全更新的低秩适应

arXiv cs.LG ↗ · 2026-06-01 缓存

CSULoRA是一种事后方法,用于纠正训练后的LoRA适配器,以在保持实用性的同时保留安全对齐,该方法利用最接近安全更新估计。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈