标签
加州理工学院(Caltech)与 Accelerated Understanding 的 Animashree Anandkumar 将在 SC26 上发表题为《大模型之后的下一个扩展律:理解物理世界的 AI》的主题演讲,内容涵盖从 FourCastNet 到天气、核聚变和生物学领域 AI 驱动科学发现的最新进展。
本文探讨了不同候选生成计划对大语言模型在测试时扩展过程中的能耗和性能的影响,表明更大的批次大小可以减少能耗和延迟。
首个 Guix-Science 频道的发布为 Guix 包管理器提供了一个专门的、社区驱动的科学软件目录,增强了科学计算的可重复性和协作性。
该推文推荐了Algorithmica的HPC系列中关于CPU缓存的部分,详细介绍了延迟、内存访问模式和理论延迟等概念,以帮助编写更快的软件。
AMD发布了其开源GPU计算平台的重大更新ROCm 10.0,标志着十年发展历程,并通过ROCm.AI引入了原生智能体AI开发体验。
本文提出了一种以验证为中心的AI辅助GPU移植工作流程,应用于一个25万行遗留气象模拟代码,实现了5.1倍的应用级加速,并通过仔细验证解决了数值差异。
来看看HP Z8 Fury工作站的疯狂2TB DDR5配置,仅内存就要花费超过20万美元,以及当前Nvidia RTX Pro 6000涨价如何使得购买带4张GPU的基础系统比单独购买显卡更划算。
Quantinuum与NVIDIA携手一家制药合作伙伴,验证了一个原理验证性的生成式量子AI(GenQAI)框架,该框架结合了HPC、AI和量子计算,用于生成并执行面向药物研发的量子电路。
Google Cloud 被指定为 NOAA 的天气与气候业务超算系统的主要 HPC 提供商,使其能够在公有云中进行业务数值天气预报,以实现更快的模拟和拯救生命的预警。
在AMD Zen 3上对FP32矩阵乘法优化的系统性探索,使用AVX2/FMA内联指令实现了85.30 GFLOPS(理论峰值的63.5%),超越了朴素实现56.5倍,并达到了优化库的性能水平。
本文提出了一种非参数贝叶斯逆强化学习方法,使用狄利克雷过程先验从专家演示中推断多个潜在奖励类型,并通过Ray实现并行的折叠吉布斯采样器以提高可扩展性。
Guix HPC 团队的一篇详细博客文章,描述他们如何在 Slingshot 互连上识别并调试 MPI 堆栈中的性能回退问题,展示了 Guix 的透明性和控制能力。
l 是一个用于 k4、q 和 qSQL 的新运行时,提供透明的 SIMD、压缩向量和自动并行性,同时保持与现有代码的完全兼容。它针对华尔街的高性能计算。
Anthropic发布的Claude Science桌面应用,专注于解决科学家日常科研中的数字体力活,如数据整合和超算调度,而非追求宏大叙事的AI科学家,通过自然语言接口降低科学计算门槛。
ISC High Performance 2026上的半日教程,关于使用编译器辅助工具(FPChecker/LLVM)进行C/C++科学代码的浮点错误分析与性能分析。
位于中国深圳的LineShine超级计算机凭借2.198 Exaflops的持续FP64性能,荣登TOP500榜首,该计算机采用定制的Armv9 CPU,拥有1300万个核心。同时,它在HPCG基准测试中也领先于El Capitan。
中国建造了全球最快的超级计算机LineShine,在TOP500排名中超越美国系统El Capitan。该系统仅使用CPU,且硬件和软件完全国产化,展示了在面对美国出口限制时的技术自给自足。
中国的LineShine超级计算机成为世界最快的计算机,自2017年以来首次取代美国的El Capitan,标志着高性能计算排名的重大转变。