标签
本文介绍了一种配置,通过 Thunderbolt 5 在 MacBook Pro 上使用 AMD Radeon AI Pro R9700 GPU,结合自定义驱动和 LemonSeed-Engine 运行大语言模型如 Qwen3.6-3.8。
用户分享了他们的本地AI配置,利用两个BC-250前挖矿APU和llama.cpp运行Qwen3.6-35B-A3B模型,实现60 tok/s和64k上下文,成本低于300美元。
Modal 详细介绍了他们如何为万亿参数编码代理优化推理性能,为其服务在吞吐量和交互性方面实现了显著提升。
Microsoft Research的发现表明,将AI推理从机器人卸载到边缘或云系统可以提高物理AI应用的任务成功率、效率和电池寿命。
介绍了 vLLM 中的硬件无关层,以在确保跨多样化硬件可移植性的同时保持高性能,正如 PyTorch Foundation 博客文章中所宣布的。
该推文突出了从美国西海岸调用 Jev 的低延迟和可扩展性,每个请求处理 6 个问题需要 130 毫秒,并且在高并行性下延迟几乎恒定,表明设计良好,并且随着专业模型的增加,未来潜力更大。
由于能够获得先进的 Nvidia 和 AMD 芯片,美国公司可以以十分之一的成本提供 Kimi K3 服务,但具有讽刺意味的是,随着研发转移到中国,硬件优化可能会进一步降低成本。
推文暗示,未来的AI推理硬件可能不会来自NVIDIA等现有提供商,强调了收购Groq等初创公司,因为GPU并非针对推理进行优化。
本文研究了 Anthropic 的 Fable 5 模型推理设置变化导致的性能退化,并强调推理质量对于实现前沿 AI 能力至关重要。
一名用户成功运行了 Qwen 3.8 27B AI 模型在 RTX 3060 和 5060 Ti GPU 的混合设置上,使用 exllamav3 的张量并行技术,在启用 MTP 的情况下达到约每秒 50 个令牌的速度。
Baseten 的 CEO Tuhin Srivastava 透露,Baseten 上的 token 量同比增长了 40 倍,而收入在过去 12 个月左右增长了约 10 倍,突显了 AI 推理的爆炸性增长。
Laya 模型使用 CoreML 在苹果的 M4 芯片上离线运行,推理速度达到每秒45次决策。
Laya-MLX是一个开源工具,用于在Apple Silicon上本地运行类型化决策AI模型,具有低延迟,提供无需云API的原生推理。它包括基准测试,显示在M3 Max等设备上的快速性能。
这篇文章介绍了一个名为 focus-llama 的 llama.cpp 分支,它实现了最近一篇论文中的声明式注意力(Declarative Attention),允许模型在推理过程中声明所需的上下文块,以优化 KV 缓存使用并减少解码时间。
预计到2031年,开源与本地部署模型将在隐私敏感及成本敏感型机构的常规推理任务中占据主导地位,从而削弱OpenAI和AnthropicAI等云端人工智能公司的市场地位。
文章宣布了DFlash2在Atlas上的测试,并详细介绍了atlasctl,这是一个用于在NVIDIA DGX Spark系统上部署和运行LLM推理模型的命令行工具。
Halogen 版本 0.12.0 修复了高上下文深度下的性能下降问题,展示了在 AMD Ryzen AI Max+ 硬件上,Qwen3.8-Flash-Next 在 100万令牌上下文时的解码和预填充速度的提升。
一位用户使用改装的矿卡从旧电脑搭建家庭服务器,通过驱动补丁和硬件升级,实现了Qwen 3.8 27B AI模型每秒约30个令牌的推理速度。
一条推文解释了推理工程的核心组成部分:可加载编码、后端操作和原生硬件算术,并讨论了内核和GPU效率。