high-performance-computing

标签

Cards List
#high-performance-computing

纪念 Johannes Doerfert

Lobsters Hottest ↗ · 2026-09-25 缓存

纪念 Johannes Doerfert,突出他对 LLVM 编译器项目的重要贡献,包括在 Attributor 框架、OpenMP offloading 和多面体优化方面的工作,以及他对开源社区的影响。

0 人收藏 0 人点赞
#high-performance-computing

Go中的平台无关SIMD

Lobsters Hottest ↗ · 2026-09-24 缓存

Go引入了实验性的SIMD API,以启用平台无关的SIMD操作,旨在在不同CPU架构上提供接近汇编的性能。

0 人收藏 0 人点赞
#high-performance-computing

面向隐半马尔可夫模型的高性能张量形式化 Viterbi 算法

arXiv cs.LG ↗ · 2026-09-16 缓存

本文提出了一种针对隐半马尔可夫模型的 Viterbi 算法张量形式化方法,支持在 CPU 和 GPU 上并行化,相比顺序实现实现显著加速。

0 人收藏 0 人点赞
#high-performance-computing

融合实验室:当AI推理、自主实验、高性能与量子计算重塑化学

arXiv cs.AI ↗ · 2026-09-10 缓存

本文评论探讨了AI推理、自主实验、高性能计算和量子计算的融合如何重塑化学并加速材料科学发现。

0 人收藏 0 人点赞
#high-performance-computing

Deepity: 一个C++库,展示预测编码网络可以媲美反向传播(在60秒内MNIST上达到97.73%) [P]

Reddit r/MachineLearning ↗ · 2026-09-02

Deepity C++库实现了优化的预测编码网络,以在MNIST上实现接近反向传播的性能,准确率为97.73%,耗时59.5秒。

0 人收藏 0 人点赞
#high-performance-computing

CUDA-Harness:从自然语言驾驭智能体CUDA内核生成与优化

arXiv cs.CL ↗ · 2026-09-02 缓存

CUDA-Harness是一个利用智能体技术从自然语言描述生成和优化CUDA内核的框架,通过连接高级语义与低级实现和验证来解决Text2CUDA中的挑战。

0 人收藏 0 人点赞
#high-performance-computing

@PyTorch:在#PyTorchCon北美2026大会上,内核工程轨道深入探讨编译器、优化、自定义内核等,……

X AI KOLs Timeline ↗ · 2026-09-01 缓存

PyTorchCon北美2026大会设有内核工程轨道,专注于编译器、优化、自定义内核和系统工作,并有Mark Saroufim的主题演讲。

0 人收藏 0 人点赞
#high-performance-computing

Tenstorrent Quietbox 2 发布啦!

Reddit r/LocalLLaMA ↗ · 2026-08-29

Tenstorrent发布了Quietbox 2,这是一款高性能系统,配备256GB内存和128GB互联的GDDR,专为AI开发设计,具有令人印象深刻的可扩展性和互联功能。

0 人收藏 0 人点赞
#high-performance-computing

XPU如何满足世界级AI工厂的需求

NVIDIA Blog ↗ · 2026-08-24 缓存

NVIDIA的NVLink Fusion技术使定制XPU能够与其AI基础设施集成,提升性能,加速产品上市时间,并降低大规模AI工厂的成本。

0 人收藏 0 人点赞
#high-performance-computing

Rust 中的 GPU 卸载:可移植、安全且快速

Hacker News Top ↗ · 2026-08-17 缓存

本文介绍了一种零开销、多厂商的 GPU 编译框架,该框架内置于 Rust 编译器中,利用 Rust 的所有权模型确保内存安全,并实现与原生 CUDA 和 HIP 基准相媲美的性能。

0 人收藏 0 人点赞
#high-performance-computing

Atomarine: 海上核数据中心

Hacker News Top ↗ · 2026-07-30 缓存

Atomarine 提出在海上建设浮动的数据中心园区,由天然气(未来使用核反应堆)供电,利用海水冷却和标准化驳船,以绕过人工智能计算的电网接入延迟。

0 人收藏 0 人点赞
#high-performance-computing

ParBench:用于可靠评估LLM并行代码翻译的基准测试

arXiv cs.AI ↗ · 2026-07-28 缓存

ParBench是一个基准测试框架,用于评估基于LLM的跨CUDA、OpenMP、OpenCL和OpenMP目标卸载的并行API翻译,侧重于可执行、可重现的条件和鲁棒性测试。

0 人收藏 0 人点赞
#high-performance-computing

从过载到洞见:AI代理如何支持科学家分析复杂数据

arXiv cs.AI ↗ · 2026-07-21 缓存

本文介绍了一种智能体AI系统,旨在通过检索文档和生成分析代码,协助欧洲XFEL的科学家分析复杂的实验数据,并与高性能计算环境集成。

0 人收藏 0 人点赞
#high-performance-computing

DeadPool:通过零开销检查点实现热插拔的弹性LLM训练

arXiv cs.LG ↗ · 2026-07-03 缓存

DeadPool 为 LLM 训练引入了一种容错机制,能够通过零开销的内存检查点实现故障节点与备用节点的热插拔,在不中断任务的情况下实现快速恢复。

0 人收藏 0 人点赞
#high-performance-computing

@0x0SojalSec: 去他妈的付费课程,掌握AI系统的GPU工程。从基础书籍和CUDA/ROCm编程到低阶…

X AI KOLs Timeline ↗ · 2026-07-02 缓存

一份精心整理的资源列表,用于掌握AI系统的GPU工程,涵盖CUDA、ROCm、优化工具、多GPU编排和分布式训练。

0 人收藏 0 人点赞
#high-performance-computing

@Jolyne_AI: GitHub 开源 CUDA 系统教程:LeetCUDA(从入门到进阶,一站打通) 200+ 个循序渐进的 CUDA Kernel 实战题,配套 HGEMM 库性能可达 cuBLAS 的 98%~100%。另有 100+ 篇高性能计算技术…

X AI KOLs Timeline ↗ · 2026-06-28 缓存

LeetCUDA是一个GitHub上开源的CUDA系统教程,包含200多个循序渐进的CUDA Kernel实战题和100多篇高性能计算博客,配套HGEMM库性能可达cuBLAS的98%~100%,适合CUDA初学者和AI工程师系统掌握CUDA优化。

0 人收藏 0 人点赞
#high-performance-computing

@shreyansh_26: https://x.com/shreyansh_26/status/2069125463860302212

X AI KOLs Timeline ↗ · 2026-06-22 缓存

本文介绍了Decompose-K技术,用于加速瘦高大K矩阵乘法,通过将K维度分割成块,执行批量矩阵乘法,并求和部分结果。还提供了PyTorch实现和基准测试,显示对于形状不佳的矩阵乘法,相比标准torch.compile有显著加速。

0 人收藏 0 人点赞
#high-performance-computing

从材料模拟到实验天文学,全新NVIDIA AI软件推动科学发现

NVIDIA Blog ↗ · 2026-06-22 缓存

NVIDIA宣布推出新的AI软件库和微服务——DAQIRI、ALCHEMI和cuPhoton——大幅加速天文学、材料科学和粒子物理等领域的科学计算任务,相比基于CPU的流水线可实现高达14,900倍的加速。

0 人收藏 0 人点赞
#high-performance-computing

@Damir_Akaza: 简街(Jane Street),全球最富有、最神秘的公司之一,每年付给他33万到60万美元,……

X AI KOLs Timeline ↗ · 2026-06-17 缓存

一条推文讲述了一位数学天才如何为简街(Jane Street)构建了一套每秒可处理数万亿次运算的AI系统,并赚取高额薪水,同时推荐了一场解释该方法的讲座。

0 人收藏 0 人点赞
#high-performance-computing

HPC-LLM:面向HPC支持的实用领域自适应与检索增强生成

arXiv cs.LG ↗ · 2026-05-19 缓存

本文介绍了HPC-LLM,一个面向HPC工作流的检索增强与领域自适应助手,基于HPC文档使用QLoRA微调Llama 3.1 8B模型。实验表明,该模型在资源需求显著降低的情况下,性能与更大的通用模型相当。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈