CogScale: 可扩展的序列处理基准测试
摘要
CogScale 是一个包含14个可扩展合成任务的基准测试,旨在隔离并评估序列处理模型中的认知与记忆能力。它提供了一个轻量级框架,用于快速验证架构设计,并在严格的参数预算下评估了七种架构。
arXiv:2605.19758v1 公告类型: 新
摘要:随时间推移维持和操控信息的能力是生命体与人工智能的基本特征。尽管现代模型在自然语言处理等任务中取得了显著成功,但评估新型架构处理序列信息的能力在计算上仍然昂贵且耗时。测试新架构通常需要扩展到大规模数据集和模型,导致巨大的计算成本与缓慢的迭代周期。本文提出了 CogScale,一个包含14个可扩展合成任务的基准测试,旨在不同可参数化尺度下隔离并评估特定的认知与记忆能力。通过提供标准化的轻量级框架,CogScale 使研究人员能够在投入大规模训练前快速验证架构创新。为建立稳固基线,我们评估了七种不同的架构:门控循环单元(GRU)、长短期记忆网络(LSTM)、xLSTM、回声状态网络(ESN)、Mamba、Transformer 解码器以及 Transformer 编码器-解码器。这些评估在严格的参数预算(1k、10k 和 100k)以及不同的难度等级和规模下进行。结果显示,尽管经典 RNN 和回声状态网络在严格参数预算下擅长基础记忆保持,但只有注意力机制和现代状态空间模型在推理复杂性和任务难度提升时能持续保持高性能。
相似文章
为代理式编码扩展测试时计算
一种面向代理式编码的测试时扩展框架,可将 rollout 轨迹压缩为结构化摘要,并通过递归投票/PDR 将 Claude-4.5-Opus 在 SWE-Bench Verified 上的成绩提升至 77.6%。
@swyx: 终于!来自Cog的首个评估产品发布!!!!!! 作为背景说明:@METR_Evals 的上限约为16小时。Cog已推出私有企业级评估…
Cognition发布了Devin的首个评估套件,提供长达100小时的企业级评估并附有财务保证。数据集包含来自126家企业用户的真实Java/TypeScript/Python/C#任务,旨在比现有基准更准确地衡量工程生产力。
Complexity Ceiling Benchmark:深度缩放下的多领域顺序推理评估
介绍复杂度天花板基准(CCB),该基准评估LLM推理能力随顺序步骤增加而衰减的情况,涵盖三个领域。研究发现一致的每步几何衰减,并且所有模型在传递性社会逻辑中在5步内崩溃,即使整体准确性很高。
SWE Context Bench 刚刚证明了一件我想很多编码代理用户已经感受到的事情
新的基准论文《SWE Context Bench》测试编码代理能否跨任务复用知识,凸显了现有基准仅评估孤立问题解决的不足。作者讨论了外部记忆等解决方案,并提到了 langmem、mem0、supermemory 和 Greplica 等工具。
@scaling01: Opus 4.8 是目前最好的编程模型。Cognition 的 FrontierCode 可能是最高质量的编程基准测试……
Cognition 推出了 FrontierCode,这是一个高质量的编程基准测试,超越了单纯的单元测试,用于衡量代码的可维护性、回归安全性和质量,由 20 多位开源开发者精心设计了 150 个任务。