标签
在启用 ARM 的硬件加速 SHA-256 后,uv 将在下一个版本中提速,将 Trio 安装的墙上时间提升高达 10%。
Gemma 4 现在可以使用 React Native 在设备端完全离线运行,通过 Android 上的 Vulkan 和 Apple Silicon 上的 MLX 实现本地硬件加速,支持视觉和工具使用能力,例如阅读传单和安排日程,完全在设备端完成。
Discord、Steam和Telegram等应用即使在最小化时也会预留显存,总共消耗1GB以上;使用大语言模型(LLM)的用户应关闭这些应用或禁用硬件加速以释放显存。
一份全面的 Apple Neural Engine 逆向工程指南,详细介绍了其在 A11 至 A18 和 M1 至 M5 芯片上的架构、编程接口和性能,基于对私有运行时、编译器和固件的直接测量和静态分析。
介绍一个万能下载器,用户只需在微信中将视频链接发送给机器人,系统会自动识别平台、解析下载、转码并回传视频,支持抖音、YouTube等14+平台,内置ffmpeg和GPU硬件加速。
x86生态系统咨询小组发布了AI计算扩展(ACE)规范,该规范定义了新的x86指令和寄存器状态,用于加速机器学习工作负载中的矩阵乘法和低精度数据格式。
一个自定义的FPGA实现,在80 MHz下运行带KV缓存的Transformer,实现每秒56,000 tokens,在微型LCD上运行microGPT。
微软研究院在最新的Research Focus通讯中重点介绍了多项进展,包括使用CoddSpeed实现30倍加速分析、AI野生动物重新识别,以及无需重新训练即可跨任务学习的LLM。
一款逐门定制的数字芯片,在仅80 MHz频率下运行含KV缓存的Transformer,实现每秒超过56,000 tokens,并在FPGA上完成原型验证。
本文介绍了作者的硕士论文,该论文利用Kolmogorov-Arnold网络(KAN)在FPGA上实现超快机器学习,通过自定义硬件架构实现亚微秒级推理和在线学习。文章引用了两篇已接收的论文:基于LUT评估的KANELÉ(FPGA 2026最佳论文奖)以及一种在FPGA上进行在线学习的方法(ICML 2026)。
OpenCV 5 是计算机视觉库的重大版本更新,包含全新的 DNN 引擎、改进的 ONNX 支持、硬件加速以及更简洁的架构。对于从事经典视觉、深度学习及边缘部署的开发者而言,这标志着一次重要的现代化升级。
作者开源了一个在FPGA上实现的自定义AI加速器(atik),原生支持BF16和注意力机制,展示了在各种模型上相比PyTorch的显著加速效果。
本文介绍了动态超度量注意力(Dynamic Ultrametric Attention),这是一个框架,其中Transformer在训练期间学习每头块稀疏路由拓扑,然后在推理时将这些拓扑卸载到自定义的Triton块稀疏内核上,与密集注意力相比,实现了高达28倍的加速和98.4%的内存减少。
介绍了Stratum,一种采用3D堆叠DRAM的系统硬件协同设计方法,以高效加速混合专家(MoE)模型。
一名用户反馈,在恢复包含 63k 令牌的长周期 LLM 推理会话时,ds4 SSD 缓存的性能表现良好,并指出启动时间尚可接受。
关于在AMD Ryzen AI 7 350 NPU上实现峰值TOPS性能的技术深度剖析,与Xilinx AIE-ML v2 AI引擎进行比较,并解释用于矩阵乘法工作负载的硬件架构。
一篇详细的回顾文章,讲述如何组装一台1997年时代的《雷神之锤》PC,并对硬件加速版VQuake进行基准测试,重点介绍Rendition Verite 1000显卡及其独特功能,包括双线性过滤和全亮度支持。
Clypra 是一款免费开源的专业视频编辑器,基于 Tauri v2、React 19 和 Rust 构建,支持硬件加速处理及可选的 AI 驱动功能。