@no_stp_on_snek: 小步前进。昨晚朋友远程进行的AMD开发:https://github.com/Avarok-Cybersecurity/atlas/pull/1107……
摘要
远程开发已为Atlas LLM推理引擎添加了AMD R9700(RDNA 4)支持,使其能够在硬件上运行像Qwen3.8-27B和Ornith-9B这样的模型。
查看缓存全文
缓存时间: 2026/09/17 20:27
纯Rust大语言模型推理,从掌上设备到数据中心机架。
网站 · 文档 · 博客 · Discord · 部署指南
atlascybernetics.ai · docs.atlascybernetics.ai · blog.atlascybernetics.ai
相似文章
@no_stp_on_snek: 进行中
推广 Atlas Inference,这是一个开源推理服务工具,在 Qwen3.6-35B-A3B 基准测试上实现了 200+ tok/s 的性能。
@leopardracer: https://x.com/leopardracer/status/2055341758523883631
一位用户分享了他们搭建双GPU本地AI实验室的经验,使用了RTX 4080 Super和5060 Ti,通过llama.cpp和llama-swap运行Qwen 3.6模型,以降低API成本并实现无限制的实验。
@no_stp_on_snek: 提醒一下,自8月30日起已在Atlas主线测试DFlash2。:) https://github.com/Avarok-Cybersecurity/atlas-re…
文章宣布了DFlash2在Atlas上的测试,并详细介绍了atlasctl,这是一个用于在NVIDIA DGX Spark系统上部署和运行LLM推理模型的命令行工具。
@pupposandro: https://x.com/pupposandro/status/2054241934164492328
该文章宣布了 llama.cpp 对 AMD Strix Halo 集成 GPU (iGPU) 上的 DFlash 和 PFlash 投机解码的支持,并展示了使用 ROCm 时推理性能的显著提升。
@no_stp_on_snek: https://x.com/no_stp_on_snek/status/2052833502475833384
使用 Qwen2.5-32B-Instruct 搭配 longctx 和 vllm-turboquant 的单个 AMD MI300X 开源技术栈,在 MRCR v2 百万级上下文基准测试中取得了与 SubQ 闭源模型(0.659)相竞争的结果(0.601-0.688),表明开源权重方法已接近达到同等水平。