标签
该文呼吁为AI研究更新基准测试,要求在现实条件下测试模型,并允许无限制的工具和互联网访问,指出当前的基准测试已经过时或限制过多。
HyperProve 提出了一种利用答案引导超图扩展的检索增强型问答框架,用于处理多跳问题,并在基准测试中取得了优于基线模型的性能。