标签
展示了 DeepSeek-V4-Flash-0731 在单块 40GB A100 上以 unsloth GGUF 量化版本运行,速度为 17.7 tok/s,并将 6 个专家加载到显存中,从而实现了完整的智能体编码循环。
对Vast.ai上GPU租赁价格的分析显示,由于供应限制,多GPU配置的定价与每GPU小时的标价存在显著偏差,较大的集群往往不可用或更昂贵。
Nvidia Falcon安全处理器中的一个潜在漏洞可能允许将性能受限的CMP 170HX加密货币挖矿GPU解锁为完整的A100 80GB,有望使高端AI硬件以不到1000美元的价格获得。
截至 2026 年 6 月,RunPod、Vast.ai 和 AWS 上 H100 和 A100 的 Spot/可抢占型 GPU 定价分析,指出了显著折扣但也存在波动性和可用性问题。
DiffusionGemma 的内部测试显示,在实际工作负载下,H100 与 A100 GPU 之间存在显著的性能差异;H100 在并发下的扩展性更好,且效率因工作负载类型而异,这引发了对基准测试可靠性的质疑。