标签
WorkSurface-Bench 通过 1,151 个任务,并分别评估路由分数和答案分数,来衡量企业智能体为给定查询选择正确知识表面(文档、表格或图表)的能力。实验表明,即使在工具受限的情况下,智能体在答案准确性方面仍存在困难,而表面提示能提升性能。
本文介绍了Darshana Graph,一个用于比较印度哲学的平行注释语料库,并展示了文体测量与探索性图分析。
介绍了GraphInfer-Bench,这是一个基准测试,用于评估LLMs是否能够进行图推理——生成关于节点及其邻域的开放式答案,这些答案无法从单个节点或路径中检索到。实验表明,即使是最前沿的LLMs在这些任务上也落后于普通GNNs,揭示了一个能力差距。