verifiable-tasks

标签

Cards List
#verifiable-tasks

无知还是无能?为LLM智能体构建知识门控可验证任务

Hugging Face Daily Papers · 2026-08-31 缓存

本文提出了一种知识门控任务构建协议,用于明确测试LLM智能体对隐藏知识的依赖性。校准任务验证表明,在无法访问私有约定时,模型性能会显著下降。

0 人收藏 0 人点赞
#verifiable-tasks

LongWoF-Bench:评估用于可验证长工作流任务的EvoMap Genes

Hugging Face Daily Papers · 2026-08-24 缓存

本文介绍了LongWoF-Bench,一个用于评估长工作流任务的基准,并证明EvoMap Gene通过重用经过验证的执行经验,提高了任务完成效率并降低了令牌成本。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈