@FGuzmanAI: 仅80 MHz下每秒56,000+ tokens。我将完整Transformer(含KV缓存)烧录到定制芯片中。逐门设计……
摘要
一款逐门定制的数字芯片,在仅80 MHz频率下运行含KV缓存的Transformer,实现每秒超过56,000 tokens,并在FPGA上完成原型验证。
查看缓存全文
缓存时间: 2026/06/13 20:16
56,000+ tokens/sec,仅在80 MHz频率下。🤯
我把一个带KV缓存的完整Transformer烧进了定制芯片中。逐门设计,做成100%数字集成电路。在FPGA上完成了原型实现。(无GPU,无CPU) 纯粹的数字硅片,运行 @karpathy 的 microGPT,在 https://t.co/hXX8kKIxiA 上拼出名字。
相似文章
SparseKAN: Compressing Kolmogorov--Arnold Networks Across Basis Functions, Neurons, and Bits
SparseKAN is a unified compression method for Kolmogorov–Arnold Networks that prunes basis functions, neurons, and numerical precision under learnable gates, achieving up to 73% parameter reduction and significant latency improvements on software and FPGA hardware.
@charliermarsh:原来我忘了为 ARM 启用硬件加速的 SHA-256。所以 uv 在下一个版本中会快很多……
在启用 ARM 的硬件加速 SHA-256 后,uv 将在下一个版本中提速,将 Trio 安装的墙上时间提升高达 10%。
优化Transformer神经网络在FPGA上的实时异常检测
本文探讨了在FPGA上优化Transformer神经网络推理以实现金融时间序列的实时异常检测,并在PYNQ-Z2开发板上展示了高效的实现。
3D打印的F-14雄猫战斗机使用FPGA重现了首个微处理器
一位FPGA专家重现了F-14雄猫战斗机的中央大气数据计算机,采用FPGA实现,并在该战斗机的3D打印模型中进行了测试,该模型控制着变后掠翼系统。这一重现使用了MP944微处理器,有些人认为它是世界上第一款微处理器。
在我们的自定义CPU上运行Doom并走红
作者描述了在逻辑门级别设计自定义CPU、集成带有缓存的DDR3内存,并成功在FPGA上运行Doom的经历,该经历随后走红网络。