CogScale: 可扩展的序列处理基准测试

arXiv cs.AI 论文

摘要

CogScale 是一个包含14个可扩展合成任务的基准测试,旨在隔离并评估序列处理模型中的认知与记忆能力。它提供了一个轻量级框架,用于快速验证架构设计,并在严格的参数预算下评估了七种架构。

arXiv:2605.19758v1 公告类型: 新 摘要:随时间推移维持和操控信息的能力是生命体与人工智能的基本特征。尽管现代模型在自然语言处理等任务中取得了显著成功,但评估新型架构处理序列信息的能力在计算上仍然昂贵且耗时。测试新架构通常需要扩展到大规模数据集和模型,导致巨大的计算成本与缓慢的迭代周期。本文提出了 CogScale,一个包含14个可扩展合成任务的基准测试,旨在不同可参数化尺度下隔离并评估特定的认知与记忆能力。通过提供标准化的轻量级框架,CogScale 使研究人员能够在投入大规模训练前快速验证架构创新。为建立稳固基线,我们评估了七种不同的架构:门控循环单元(GRU)、长短期记忆网络(LSTM)、xLSTM、回声状态网络(ESN)、Mamba、Transformer 解码器以及 Transformer 编码器-解码器。这些评估在严格的参数预算(1k、10k 和 100k)以及不同的难度等级和规模下进行。结果显示,尽管经典 RNN 和回声状态网络在严格参数预算下擅长基础记忆保持,但只有注意力机制和现代状态空间模型在推理复杂性和任务难度提升时能持续保持高性能。
查看原文

相似文章

为代理式编码扩展测试时计算

Hugging Face Daily Papers

一种面向代理式编码的测试时扩展框架,可将 rollout 轨迹压缩为结构化摘要,并通过递归投票/PDR 将 Claude-4.5-Opus 在 SWE-Bench Verified 上的成绩提升至 77.6%。