标签
Unconventional AI 的首个模拟 AI 芯片,使用耦合谐振器,生成图像仅需不到 900 纳焦,号称在 AI 硬件能效上提升了 1000 倍。
NVIDIA报告称,与GB300相比,Vera Rubin的每兆瓦智能体吞吐量最高提升30倍,但强调生产基准测试应包含超越每瓦令牌数的额外指标。
Parasma 创始人兼CEO @vytalow 认为,使用人类脑细胞进行计算可能比硅芯片节能得多,并指出了功耗效率、样本效率和持续学习方面的优势。
本文比较了在 Strix Halo(每天最多 0.48 美元)与 Nvidia A6000 上运行 AI 模型的能源成本,强调了能效和多功能性。
AI 推理硬件初创公司 Etched 在获得 8 亿美元融资并签署超过 10 亿美元客户合同后结束隐身模式。首批机架将于今年夏季发货,声称在吞吐量、延迟和能效方面达到业界领先水平。
由Databricks前AI负责人Naveen Rao领导的Unconventional AI公司声称,其基于振荡器的计算机架构可将AI推理能耗降低多达1000倍,并已通过其首个图像生成模型Un0进行了验证。
在Google Pixel 10 Pro上使用llama.cpp运行Gemma 12B模型,实现了每秒6.5个token的提示处理和每秒1.3个token的生成,功耗低于10瓦,展示了高效的设备端AI推理。
Nvidia推出了与Lambda合作的光子共封装光学交换机,旨在减少大型GPU集群在AI工作负载中的功耗和故障点。
一项对8个小型LLM(参数规模从1.35亿到约10亿)在售价250美元的Jetson Orin Nano Super上进行的深入基准测试,涵盖四种功率模式,发现25W是帕累托最优模式,其中SmolLM2-135M达到165.1 tok/s,效率最高。
一位用户对 RTX 5090 和 RTX 6000 PRO 系列 GPU 进行 AI 扩散任务基准测试,比较不同功耗限制下的性能,展示了速度与功耗之间的权衡。
一位用户分享了在运行Qwen3.6-27B与vLLM的4x RTX 3090平台上进行的功耗限制测试,发现220W是在最小化吞吐量损失下实现峰值效率的甜点。
一位用户使用 llama.cpp 对 Nvidia 5090 RTX GPU 进行 LLM 推理基准测试,测量了不同功耗水平下的提示处理和 token 生成情况,发现提示处理对功耗限制更为敏感,而 token 生成相对不敏感,并指出了与 4090 RTX 的差异。
用户实测两台华硕 GX10(DGX Spark)运行 MiniMax-M2.7-AWQ-4bit,每块仅约 100 W,生成速度 30–40 tokens/s,彻底替代嘈杂的多 GPU 机架。