标签
本文介绍了LittleLearner,一个用于研究LLM知识获取的受控沙箱,使用K-5课程过滤的数据集,发现诸如规模化和后训练等干预措施能增强范围内的性能,但无法提升范围外的能力。
本文通过引入SearchGen-20K基准和SearchGen-Corpus-1M语料库,解决了视觉生成中的知识边界问题,并提出了一种先教后搜索的协同训练框架,以处理超出生成器训练数据的、不断演化的长尾用户请求。
本文介绍了Know2Guess,一种污染感知的多区域基准,旨在评估大型语言模型从可回答知识到预期拒答的转换,解决数据污染、提示敏感性和拒绝行为问题。作者评估了FLAN-T5、Qwen2.5-Instruct和Llama-3-Instruct模型,发现更强的模型表现出选择性但不完全的拒答。该基准和数据集已公开发布。
本文提出ReverieMem,一种用于基于书籍的LLM角色扮演代理的三层记忆架构,可防止事实越界和风格单调。同时引入了KBF-QA基准测试,并在知识边界保真度和叙事质量方面取得了显著改进。
本文提出AKBE,一种用于LLM智能体强化学习的在策略方法,能够动态判断何时需要使用工具以及何时内部知识足够,平均准确率提升+1.85,工具调用次数相比标准智能体RL减少18%。