knowledge-leakage

标签

Cards List
#knowledge-leakage

TEMPO:通过模式分离策略优化实现时间强制,用于可信的大语言模型回测

arXiv cs.LG · 2026-05-20

提出TEMPO,一种策略优化方法,通过使用双模式奖励和基于GRPO的训练,训练大语言模型仅依据截止日期前的信息进行推理,将知识泄露降低2–13%,同时将任务性能提升6–13%。

0 人收藏 0 人点赞
#knowledge-leakage

为稳健的 RAG 评估生成无知识泄露的基准测试

arXiv cs.CL · 2026-05-12 缓存

本文介绍了 SeedRG,这是一个半合成的基准测试生成管道,旨在通过创建保留推理结构但不在模型参数记忆中的新实例,消除检索增强生成 (RAG) 评估中的知识泄露。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈