标签
本文提出了一种知识门控任务构建协议,用于明确测试LLM智能体对隐藏知识的依赖性。校准任务验证表明,在无法访问私有约定时,模型性能会显著下降。
本文介绍了LongWoF-Bench,一个用于评估长工作流任务的基准,并证明EvoMap Gene通过重用经过验证的执行经验,提高了任务完成效率并降低了令牌成本。