ai-inference

标签

Cards List
#ai-inference

在 Razer 外接盒中使用 Thunderbolt 5 运行 AMD Radeon AI PRO R9700 的 MacBook Pro M5 Max LSE LLM

Reddit r/LocalLLaMA ↗ · 2026-09-24

本文介绍了一种配置,通过 Thunderbolt 5 在 MacBook Pro 上使用 AMD Radeon AI Pro R9700 GPU,结合自定义驱动和 LemonSeed-Engine 运行大语言模型如 Qwen3.6-3.8。

0 人收藏 0 人点赞
#ai-inference

我对本地AI的探索:使用两个BC-250前挖矿APU运行Qwen3.6-35B-A3B Q4_K_M,达到60 tok/s和64k上下文

Reddit r/LocalLLaMA ↗ · 2026-09-24

用户分享了他们的本地AI配置,利用两个BC-250前挖矿APU和llama.cpp运行Qwen3.6-35B-A3B模型,实现60 tok/s和64k上下文,成本低于300美元。

0 人收藏 0 人点赞
#ai-inference

@charles_irl: 之后,人们一直问我们 @modal 是如何能够如此出色地提供代理推理服务的。所以我们把这一切都写了下来。新博…

X AI KOLs Timeline ↗ · 2026-09-23 缓存

Modal 详细介绍了他们如何为万亿参数编码代理优化推理性能,为其服务在吞吐量和交互性方面实现了显著提升。

0 人收藏 0 人点赞
#ai-inference

@MSFTResearch:机器人变得更智能,但它们的硬件如何跟上这种增长?Microsoft Research的新发现表明将AI推理移出机器人……

X AI KOLs Following ↗ · 2026-09-23 缓存

Microsoft Research的发现表明,将AI推理从机器人卸载到边缘或云系统可以提高物理AI应用的任务成功率、效率和电池寿命。

0 人收藏 0 人点赞
#ai-inference

我搭建了一个双R9700系统。寻求建议。

Reddit r/LocalLLaMA ↗ · 2026-09-23

一位用户搭建了双R9700系统,正在寻求社区关于各种AI推理、微调和系统优化主题的建议。

0 人收藏 0 人点赞
#ai-inference

@PyTorch: 如何保持 @vllm_project 以光速运行,同时不排斥在多样化硬件上运行多样化模型的用户?

X AI KOLs Following ↗ · 2026-09-22 缓存

介绍了 vLLM 中的硬件无关层,以在确保跨多样化硬件可移植性的同时保持高性能,正如 PyTorch Foundation 博客文章中所宣布的。

0 人收藏 0 人点赞
#ai-inference

@taroleo: 当从美国西海岸调用 Jev 时,单个请求编译 6 个问题大约需要 130 毫秒,或每个判断 20-25 毫秒。

X AI KOLs Timeline ↗ · 2026-09-21

该推文突出了从美国西海岸调用 Jev 的低延迟和可扩展性,每个请求处理 6 个问题需要 130 毫秒,并且在高并行性下延迟几乎恒定,表明设计良好,并且随着专业模型的增加,未来潜力更大。

0 人收藏 0 人点赞
#ai-inference

@rohanpaul_ai: "诸如 Modal、Fireworks 和 Baseten 等美国公司将以中国竞争对手十分之一的成本提供 Kimi K3 服务……"

X AI KOLs Timeline ↗ · 2026-09-21 缓存

由于能够获得先进的 Nvidia 和 AMD 芯片,美国公司可以以十分之一的成本提供 Kimi K3 服务,但具有讽刺意味的是,随着研发转移到中国,硬件优化可能会进一步降低成本。

0 人收藏 0 人点赞
#ai-inference

@TheAhmadOsman: 推理的未来并不一定在任何当前的硬件提供商那里,顺便说一句,无意冒犯现有厂商,…

X AI KOLs Timeline ↗ · 2026-09-21 缓存

推文暗示,未来的AI推理硬件可能不会来自NVIDIA等现有提供商,强调了收购Groq等初创公司,因为GPU并非针对推理进行优化。

0 人收藏 0 人点赞
#ai-inference

推理差距(56分钟阅读)

TLDR AI ↗ · 2026-09-21 缓存

本文研究了 Anthropic 的 Fable 5 模型推理设置变化导致的性能退化,并强调推理质量对于实现前沿 AI 能力至关重要。

0 人收藏 0 人点赞
#ai-inference

在 RTX 3060 + 5060 Ti 上成功运行 Qwen 3.8 27B EXL3

Reddit r/LocalLLaMA ↗ · 2026-09-20

一名用户成功运行了 Qwen 3.8 27B AI 模型在 RTX 3060 和 5060 Ti GPU 的混合设置上,使用 exllamav3 的张量并行技术,在启用 MTP 的情况下达到约每秒 50 个令牌的速度。

0 人收藏 0 人点赞
#ai-inference

@rohanpaul_ai: Baseten 的 CEO Tuhin Srivastava (@tuhinone) 刚刚公布了两个数字。显示了 AI 推理的爆炸性增长:token 量……

X AI KOLs Following ↗ · 2026-09-20 缓存

Baseten 的 CEO Tuhin Srivastava 透露,Baseten 上的 token 量同比增长了 40 倍,而收入在过去 12 个月左右增长了约 10 倍,突显了 AI 推理的爆炸性增长。

0 人收藏 0 人点赞
#ai-inference

Laya (OS Jev) 在 Mac M4 CoreML 离线运行(每秒45次决策)

Hacker News Top ↗ · 2026-09-20

Laya 模型使用 CoreML 在苹果的 M4 芯片上离线运行,推理速度达到每秒45次决策。

0 人收藏 0 人点赞
#ai-inference

@LinQ444: jev 与 laya 的对比 https://github.com/mizorewww/laya-mlx…

X AI KOLs Timeline ↗ · 2026-09-20 缓存

Laya-MLX是一个开源工具,用于在Apple Silicon上本地运行类型化决策AI模型,具有低延迟,提供无需云API的原生推理。它包括基准测试,显示在M3 Max等设备上的快速性能。

0 人收藏 0 人点赞
#ai-inference

focus-llama:一个实现声明式注意力的 llama.cpp 分支(arXiv:2609.02737)

Reddit r/LocalLLaMA ↗ · 2026-09-20

这篇文章介绍了一个名为 focus-llama 的 llama.cpp 分支,它实现了最近一篇论文中的声明式注意力(Declarative Attention),允许模型在推理过程中声明所需的上下文块,以优化 KV 缓存使用并减少解码时间。

0 人收藏 0 人点赞
#ai-inference

@QuixiAI:到2031年,开源/本地部署模型将承担隐私敏感和成本敏感领域中大部分常规经济型推理任务…

X AI KOLs Following ↗ · 2026-09-20 缓存

预计到2031年,开源与本地部署模型将在隐私敏感及成本敏感型机构的常规推理任务中占据主导地位,从而削弱OpenAI和AnthropicAI等云端人工智能公司的市场地位。

0 人收藏 0 人点赞
#ai-inference

@no_stp_on_snek: 提醒一下,自8月30日起已在Atlas主线测试DFlash2。:) https://github.com/Avarok-Cybersecurity/atlas-re…

X AI KOLs Timeline ↗ · 2026-09-19 缓存

文章宣布了DFlash2在Atlas上的测试,并详细介绍了atlasctl,这是一个用于在NVIDIA DGX Spark系统上部署和运行LLM推理模型的命令行工具。

0 人收藏 0 人点赞
#ai-inference

Qwen3.8-Flash-Next 在 Strix Halo 上支持 100万上下文:解码速度达 38 tok/s,预填充仅需 18 分钟 (Halogen 0.12.0)

Reddit r/LocalLLaMA ↗ · 2026-09-19

Halogen 版本 0.12.0 修复了高上下文深度下的性能下降问题,展示了在 AMD Ryzen AI Max+ 硬件上,Qwen3.8-Flash-Next 在 100万令牌上下文时的解码和预填充速度的提升。

0 人收藏 0 人点赞
#ai-inference

使用旧电脑打造家庭服务器并升级GPU。Qwen3.8 27B以每秒约30个令牌运行。

Reddit r/LocalLLaMA ↗ · 2026-09-19

一位用户使用改装的矿卡从旧电脑搭建家庭服务器,通过驱动补丁和硬件升级,实现了Qwen 3.8 27B AI模型每秒约30个令牌的推理速度。

0 人收藏 0 人点赞
#ai-inference

@TheAhmadOsman: 推理工程简单来说就是 - 可加载的编码 - 由后端实现的针对这些编码的操作 -…

X AI KOLs Timeline ↗ · 2026-09-19 缓存

一条推文解释了推理工程的核心组成部分:可加载编码、后端操作和原生硬件算术,并讨论了内核和GPU效率。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈