@lateinteraction: 目前,我认为极少数长上下文基准测试中值得重视的两个是 OBLIQ-Bench…

X AI KOLs Following 新闻

摘要

一位评论者指出,OBLIQ-Bench(recall@k)和 StudyBench(expertise)是少数可靠的长上下文基准测试中的两个。

目前,我认为极少数长上下文基准测试中值得重视的两个是 OBLIQ-Bench(recall@k)和 StudyBench(expertise)。
查看原文

相似文章

通过PredicateLongBench理解长上下文任务的难度轴

arXiv cs.AI

本文介绍了PredicateLongBench,这是一个通过测试模型识别满足谓词的连续子序列的任务来系统性地探测长上下文推理的基准,揭示了前沿模型在多个难度轴向上扩展时表现困难。