adversarial-generation

标签

Cards List
#adversarial-generation

OSCToM: RL引导的对抗生成用于高阶心智理论

arXiv cs.AI · 2026-05-22 缓存

本文提出OSCToM,一种RL引导的方法,用于生成对抗数据以测试LLM中的嵌套信念冲突,在FANToM等基准上改进了心智理论推理。

0 人收藏 0 人点赞
#adversarial-generation

SafeHarbor:面向LLM代理安全的分层记忆增强护栏

Hugging Face Daily Papers · 2026-05-07 缓存

SafeHarbor是一个用于LLM代理安全的新型框架,它利用分层记忆和自进化机制来平衡安全性与实用性,在良性任务和恶意任务上均实现了最先进的性能。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈