标签
微软研究院推出EvoLib,这是一个框架,使LLMs能够在推理过程中从自身经验中持续学习,通过提取可复用的技能和洞察,无需模型更新或外部标签。
本文介绍了EvoBrowseComp,这是一个动态基准测试,包含400个英文和400个中文复杂问题,通过实时网络遍历合成,用于评估搜索代理,避免测试集污染,确保对参数记忆的鲁棒性。
EvoBrowseComp是一个演进式基准测试集,包含800个无污染的问题,用于评估搜索智能体,旨在通过三智能体框架防止参数记忆并保持时间新鲜度。