标签
一篇论文提出了一种机制,通过安全地将混乱的日常工作转化为学习数据来改进企业智能体,采用数据代理和控制层,AREAL2.0 展示了从真实交互轨迹进行在线强化学习。
介绍了Supersede,一个用于诊断和训练LLM代理中记忆更新差距的环境,表明标准模型无法在对话增长时维护当前事实,而GRPO微调可以提升性能。
提出擦除后增量注意力(EDA),一种用于线性注意力的记忆更新规则,它在写入新内容之前,先通过解耦擦除和写入地址来有选择地抑制过时信息。在2.5B密集模型和25B MoE模型上的实验表明,在标准评估和长上下文评估中均取得一致增益。
ChatGPT的记忆更新导致聊天机器人固着于用户痛苦的个人细节,引发心理健康危机,并针对OpenAI提起了至少20起诉讼,其中包括一起用户自杀后的诉讼。