hardware-benchmark

标签

Cards List
#hardware-benchmark

构建了颜色频率压缩协议(MusCoRe),将24轮代理历史记录的令牌数量削减了71.9%——规格化一个边缘推理基准测试,以检验其是否能消除3B–7B模型对GPU的依赖

Reddit r/AI_Agents · 昨天

本文介绍MusCoRe,一种颜色频率压缩协议,可将AI代理对话的令牌使用量减少71.9%,实现在无GPU依赖的低资源设备上进行潜在本地推理。

0 人收藏 0 人点赞
#hardware-benchmark

@0xSero: Minimax-M3 在 4 块 RTX Pro 6000 上运行 - 800k 上下文 - 4 路并发 (250k) - 70-120 tok/s - 2000 tok/s 预填充无缓存…

X AI KOLs Following · 2026-06-14 缓存

Minimax-M3 被演示在 4 块 RTX Pro 6000 GPU 上运行,具备 800k 上下文,在 4 路并发下达到 70-120 tok/s 推理速度和 2000 tok/s 预填充速度,使用 376GB VRAM 和 mxfp4 格式。

0 人收藏 0 人点赞
#hardware-benchmark

受内存限制但不限于带宽:物理AI推理中批量1的LLM解码差距

Hugging Face Daily Papers · 2026-05-28 缓存

本文研究了物理AI系统中批量1的LLM解码的性能差距,发现更快的内存带宽并没有按比例减少延迟,因为启动开销的存在,并且量化效率在不同硬件间差异显著。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈