@FGuzmanAI: 仅80 MHz下每秒56,000+ tokens。我将完整Transformer(含KV缓存)烧录到定制芯片中。逐门设计……
摘要
一款逐门定制的数字芯片,在仅80 MHz频率下运行含KV缓存的Transformer,实现每秒超过56,000 tokens,并在FPGA上完成原型验证。
仅80 MHz下每秒56,000+ tokens。🤯
我将完整Transformer(含KV缓存)烧录到定制芯片中。作为100%数字集成电路逐门设计。在FPGA上原型验证。(无GPU,无CPU)
纯数字硅片运行 @karpathy microGPT,在 https://t.co/hXX8kKIxiA 上拼写出名字。
查看缓存全文
缓存时间: 2026/06/13 20:16
56,000+ tokens/sec,仅在80 MHz频率下。🤯
我把一个带KV缓存的完整Transformer烧进了定制芯片中。逐门设计,做成100%数字集成电路。在FPGA上完成了原型实现。(无GPU,无CPU) 纯粹的数字硅片,运行 @karpathy 的 microGPT,在 https://t.co/hXX8kKIxiA 上拼出名字。
相似文章
智能体能否通过更高层次的抽象设计更好的芯片?
本文探索使用LLM智能体进行芯片设计,采用更高层次的抽象,引入名为AHRR的工作流,该工作流结合了基于智能体的HLS设计与RTL细化,在基准测试中实现了比直接RTL设计快2.6倍的加速。
@TheAhmadOsman: 推理工程简单来说就是 - 可加载的编码 - 由后端实现的针对这些编码的操作 -…
一条推文解释了推理工程的核心组成部分:可加载编码、后端操作和原生硬件算术,并讨论了内核和GPU效率。
这款玩卡带的Game Boy复刻版比Analogue Pocket更小更便宜
FunnyPlaying发布了FPGB Mini,一款紧凑且实惠的掌机,使用FPGA技术玩Game Boy和Game Boy Color卡带,提供了比Analogue Pocket更便宜的替代选择。
FairCompressAgent: 一个用于FPGA部署的公平感知模型压缩智能体框架
本文提出了FairCompressAgent,一个智能体框架,它使用语言模型规划器来优化用于FPGA部署的公平感知模型压缩,平衡准确性、公平性和效率。
在FPGA上重现Voodoo Graphics和90年代末期的游戏电脑
这篇文章详细介绍了zSST的创建,这是一个用于FPGA的3dfx Voodoo Graphics的SystemVerilog实现,使得配备Voodoo显卡的DOS电脑能够运行如《古墓丽影》等经典游戏。