Transformers 本质上是简洁的

Hacker News Top 论文

摘要

本文认为 Transformer 架构本质上是简洁的,意味着它们比其他模型能更高效地表示某些函数。本文提供了理论分析和证明。

本文将在 ICLR 2026(顶级人工智能会议)上发表,并被选为三篇杰出论文之一。
查看原文
查看缓存全文

缓存时间: 2026/06/05 20:09

无法翻译:输入内容为PDF二进制数据,不是Markdown文章。

相似文章

论Transformer的表达能力

arXiv cs.AI

一篇综述论文,考察Transformer作为语言识别器的表达能力,运用电路复杂性的概念和方法将其与经典计算模型进行比较。

Z1T(15分钟阅读)

TLDR AI

Extropic引入Z1T,一种针对其概率性Z1硬件优化的稀疏类Transformer模型,通过算法-硬件协同设计提升Transformer推理的能效。

Transformer线性表示高度结构化的世界模型

arXiv cs.LG

本文证明,在数独求解轨迹上训练的Transformer构建了由领域约束组织的结构化世界模型,并识别出一个稀疏、单语义的电路,负责裸单决策规则。该工作为Transformer在组合任务上的推理提供了完全可解释的算法描述。