标签
来自南洋理工大学、康奈尔大学和布里斯托大学的研究者提出了 PowerZooJax,这是一个面向电力系统运行强化学习的开源 JAX 基准套件,提供了五个带约束的 MDP 任务(发电、输电、配电、分布式能源资源、数据中心微电网),可完全在 GPU 上运行,相比基于 CPU 的仿真器实现了大幅加速。
本文解释了Rust和WebGPU之间结构布局的细微差异,并介绍了使用naga进行单元测试的方法,以验证内存偏移,从而实现更安全的GPU计算着色器配置。
本文讨论了使用Qwen 27B模型在4090 GPU上创建动态图形,突出了受Opus 5.5启发的本地AI能力。
一个智能代理CUDA内核优化器,通过迭代代码生成、正确性检查、基准测试和优化,自动化GPU实现生成,由LangGraph和OpenAI模型驱动。
vgpu 是一个针对 WebGPU 的 TypeScript 库,具有类型化着色器导入、一个轻量级的 GPU 优先 API,并兼容浏览器、无头 Node 和测试环境。
TensorTonic是一个通过编码实践学习机器学习的在线平台,该帖子以解释RBF核函数开头。
一名用户成功运行了 Qwen 3.8 27B AI 模型在 RTX 3060 和 5060 Ti GPU 的混合设置上,使用 exllamav3 的张量并行技术,在启用 MTP 的情况下达到约每秒 50 个令牌的速度。
本文详细解释了MoE(混合专家)推理工程,纠正了关于激活参数与部署成本的误解,并深入探讨了路由器选择、运行时分组、GPU执行、内存管理和专家并行等技术细节。
作者展示了如何强制AMD MI50 GPU与ROCm 6.4.3配合工作,并构建了一个基于Vulkan的神经网络训练栈,挑战了关于旧硬件支持的共识。
Periodic Labs训练了一个开放权重AI模型,使用1,300个NVIDIA H200 GPU和内部实验室数据,在其内部基准测试中超越了GPT-6 Astra。
作者正在构建一个双 GPU 系统,用于运行大型语言模型,评估 AMD Radeon AI Pro R9700 与 NVIDIA RTX 3090 选项,同时旨在降低 AI 订阅成本。
Kanverse GPU Borrow 是一款产品,允许设备在用户明确授权下,通过 Blink Bridge 临时借用其他机器的GPU计算资源,并由 GPT-6 Astra 编排。
Cognition 的研究人员利用 AI 代理 Devin 成功分解了 RSA-260,在 RSA 因子分解挑战中创下新纪录,并展示了自主软件工程在密码学研究中的潜力。
Modal 是一个运行在 GPU 层之上的无服务器平台,简化了开发者对 GPU 的访问。
这是关于 Modal 的推广帖子,Modal 是一个 AI 基础设施平台,提供 SDK、自动扩展和生产就绪工具,同时宣布了面向 AI 工程师的 Runtime 大会。
一位用户宣布他们已经解决了LeetGPU上所有与注意力相关的问题,并将它们编译成一个易于访问的资源。
本文描述了关于 split-K 矩阵乘法的实验,揭示了答案的变异性取决于块布局和分割计数,在 B200 GPU 上的测试显示了不同条件下的输出变化。
本文提供了运行8x NVIDIA RTX PRO 6000 Blackwell GPU处理AI工作负载的实用指南,重点介绍高并发推理、模型集群和70B微调,同时与更昂贵的数据中心解决方案进行性能比较。
SlopTV是一个AI直播,利用Minimax H3在双5090 GPU上根据YouTube聊天评论生成无限内容。