标签
一条推文反对因'末日论者'的恐吓而放慢AI发展,转而主张加速。
XeBoostLM 是一款原生 C++ 命令行工具,用于在 Intel NPU、iGPU 和 CPU 上运行本地大语言模型,提供优化性能且零 Python 开销。
NVIDIA 发布 RTX PRO 5500 Blackwell 工作站版,这是一款专业 GPU,配备 84GB GDDR7 显存,专为企业的 AI 和图形工作负载而设计。
开发者宣布计划加速 LFM2.5-Audio-1.5B 模型,采用强化学习方法和合成数据,重点关注英语,并分享了 Mimi 编解码器模型的优化,以提升开源发布的速度和质量。
IBM发布面向IBM Z和LinuxONE的下一代双架构处理器,原生支持Arm和IBM Z指令集,采用2纳米技术并配备AI加速器,以增强企业计算选项。
小米的Xring O3新款CPU在单线程性能上与Apple核心相当,在多线程任务中速度更快,配备大容量缓存和先进的执行单元,适用于AI和并行处理。
讨论在非Nvidia GPU上运行CUDA软件的方法,使其他硬件能够使用Nvidia的AI生态系统。
本文分析了x86生态系统咨询小组提出的新ACE规范,该规范扩展了英特尔的AMX,用于AI矩阵乘法,具有固定块大小和外积指令,并与Arm的SME进行了比较。
中国研究人员开发了一种全光互连系统,可连接标准电子芯片,将人工智能分布式推理速度提升超过100倍,同时仅使用典型计算资源的九分之一。这项发表在《国家科学评论》上的突破,采用硅光子收发芯片和FPGA实现了显著的效率提升。
一份精心整理的资源列表,用于掌握AI系统的GPU工程,涵盖CUDA、ROCm、优化工具、多GPU编排和分布式训练。
一个精心整理的 GitHub 资源列表,用于学习 GPU 工程学,涵盖架构、内核编程、优化、分布式系统及 AI 加速,包括书籍、框架、分析工具和面试准备内容。
OpenAI与Broadcom发布了Jalapeño,一款专为LLM推理定制的芯片,每瓦性能显著优于当前最先进水平,从零开始为当前及未来AI模型设计。
Tensordyne推出了Napier,一种在硅片上使用对数数学的推理系统,声称对MoE和推理模型有巨大的效率提升,并采用风冷机架。
Anthropic内部数据显示Claude正在加速AI发展,可能通往递归式自我改进路径,AI自主构建更强大继任者的进程比预期更快。
Anthropic研究院发布了一项关于递归自我改进进展的分析报告,显示AI已在加速AI开发——工程师每季度的代码产出提升了8倍——并预测具备完全自主自我改进能力的AI系统或将比大多数机构所预期的更早到来。
陶哲轩讨论了AI如何大幅加速数学研究,减少了为进入研究前沿所需的教育年限。
OWC 宣布推出 Stack AI,这是一款集 AI 加速与存储扩展于一体的 Thunderbolt 5 设备,能够在 Windows 和 Linux 上运行更大的本地 AI 模型,减少对云端的依赖并提升隐私性。
Chinese developer @yadong_xie observes that AI has moved from assisting coding to fully controlling rendering within a year, describing global tech progress as 100× accelerated.
OpenAI发布了一篇研究论文,记录了GPT-5在数学、物理、生物学等多个领域加速科学发现的早期实验成果,包括该模型帮助识别疾病机制、解决开放性问题以及与领先大学和国家实验室合作改进优化算法的案例。