ai-inference

标签

Cards List
#ai-inference

@ManusAI: 推出Manus Flex。在Manus中使用您自己的API密钥。通过Manus代理框架、工具等使用支持的提供商……

X AI KOLs Timeline ↗ · 昨天 缓存

Manus推出Flex,这是一个新模块,允许用户使用自己的API密钥来驱动Manus的代理基础设施,初始合作伙伴包括OpenRouter、Fireworks和Modal。

0 人收藏 0 人点赞
#ai-inference

推理引擎将走向一系列一次性专用方案

Reddit r/LocalLLaMA ↗ · 昨天

本文认为,针对特定模型和硬件优化的一次性专用推理引擎,其性能将超越如 llama.cpp 等通用引擎,并预测它们将成为 AI 推理领域的主流趋势。

0 人收藏 0 人点赞
#ai-inference

vLLM 的 RAM 卸载技术 - tcclaviger 致谢帖

Reddit r/LocalLLaMA ↗ · 昨天

感谢 tcclaviger 为 vLLM 添加专家 RAM 卸载支持,使得在本地多 GPU 设置上运行 DeepSeek-V4-Flash-Vision-Exp 等大型 AI 模型成为可能。

0 人收藏 0 人点赞
#ai-inference

消息来源:推理提供商 Modal Labs 即将完成7.5亿美元融资轮,估值达157.5亿美元

TechCrunch AI ↗ · 2天前 缓存

Modal Labs,AI推理基础设施提供商,即将完成7.5亿美元融资轮,估值达157.5亿美元,较四个月前增长超过两倍,正值AI推理服务需求激增之际。

0 人收藏 0 人点赞
#ai-inference

单张3090上为Qwen3.8 27B实现95+ TPS,支持100K生成与262K上下文

Reddit r/LocalLLaMA ↗ · 2天前

LlamAmpere v0.4发布,包含Ampere特定优化,在单张NVIDIA 3090 GPU上为Qwen3.8-27B模型实现超过95 TPS的速度,并支持262K上下文。

0 人收藏 0 人点赞
#ai-inference

我称这个为Monstrosity。5块退役挖矿BC-250板卡运行Qwen3-Coder-Next Q4,速度达40 tok/s

Reddit r/LocalLLaMA ↗ · 3天前

用户使用五块退役挖矿BC-250板卡搭建了一个低成本设置,运行Qwen3-Coder-Next AI模型,在30k上下文中达到约40令牌/秒的速度,并计划扩展。

0 人收藏 0 人点赞
#ai-inference

@TheAhmadOsman: 真的,人们怎么能继续忍受这些慢得要死的云模型?和我自托管的任何东西相比,它们慢得令人痛苦…

X AI KOLs Timeline ↗ · 3天前 缓存

一条推文,批评云AI模型与自托管解决方案相比性能缓慢。

0 人收藏 0 人点赞
#ai-inference

探讨计算交易 (16分钟阅读)

TLDR AI ↗ · 3天前 缓存

本文探讨了计算衍生品的新兴市场及其改变neoclouds在AI推理云行业中管理GPU租赁风险和定价方式的潜力。

0 人收藏 0 人点赞
#ai-inference

双Tesla p100, q6_k量化, Qwen 3.8 27B 约60 tps V3.0

Reddit r/LocalLLaMA ↗ · 3天前

一位用户分享了针对Tesla P100 GPU的内核优化,以提升使用llama.cpp运行Qwen 3.8模型时的性能,实现了显著的推理加速。

0 人收藏 0 人点赞
#ai-inference

@PyTorch: 想知道如何使用@PyTorch和@vllm_project使企业智能体推理达到生产就绪状态,并深入了解…

X AI KOLs Following ↗ · 3天前 缓存

本文推广了在PyTorch Conference North America上的一场演讲,专注于使用PyTorch和vLLM使企业智能体推理达到生产就绪状态,涵盖生态系统更新和注册详情。

0 人收藏 0 人点赞
#ai-inference

针对M5 Max优化的Splash分支:速度提升约1.5倍(单请求1.25倍)

Reddit r/LocalLLaMA ↗ · 3天前 缓存

Splish是Splash的一个非官方分支,专为Apple M5 Max芯片优化Metal内核,能够在不降低质量的情况下,将AI推理速度提升高达1.5倍,适用于Qwen3.8-27B等模型。

0 人收藏 0 人点赞
#ai-inference

改进并修复的 GPT-OSS 模板(再次)。包含 preserve_thinking 和针对 Unsloth 引发的 bug 的修复

Reddit r/LocalLLaMA ↗ · 4天前

本文详细介绍了对 Unsloth 的 GPT-OSS 模板进行的一个 bug 修复。该 bug 导致在多轮推理中,聊天历史渲染错误地丢弃了模型的答案,从而引起模型性能下降。作者分享了一个更新的模板,通过保留思考过程来提升性能。

0 人收藏 0 人点赞
#ai-inference

在我的4x3060ti设置上获得了出乎意料的好结果

Reddit r/LocalLLaMA ↗ · 4天前

一位用户使用Exl3和vllm的张量并行技术优化了4x3060ti GPU配置,用于AI推理,在大型上下文窗口中实现了高达每秒120个令牌的处理速度。

0 人收藏 0 人点赞
#ai-inference

2400cc 推理竞速机:双RTX 3090引擎,NVLink涡轮增压,裸机7840U ThinkPad ECU,大众高尔夫散热器

Reddit r/LocalLLaMA ↗ · 4天前

一台使用双RTX 3090 GPU、ThinkPad主板和大众高尔夫散热器自制的推理机,能够通过vLLM运行如Qwen3.8-27B等AI模型。

0 人收藏 0 人点赞
#ai-inference

@Oluwaphilemon1: 在12GB RTX 5070上运行的Qwen3.8-Flash-Next速度只有15 tok/s,显然这不够好。所以与其买更大的G…

X AI KOLs Timeline ↗ · 4天前 缓存

一位用户构建了一个名为Strata的开源推理引擎,用于优化Qwen3.8-Flash-Next在普通硬件上的运行,将速度从最初的15 tok/s提升到了最高65.1 tok/s。

0 人收藏 0 人点赞
#ai-inference

@PyTorch: 在 @vllm_project 中的弹性专家并行性允许您在活动的混合专家部署期间动态添加或移除GPU…

X AI KOLs Following ↗ · 4天前 缓存

本文推广了在2026年PyTorch Conference North America上关于vLLM中弹性专家并行性的演讲,讨论了如何在混合专家部署中动态添加或移除GPU,同时最小化停机时间。

0 人收藏 0 人点赞
#ai-inference

单张 RTX 5090 运行 Qwen3.8:27b 实现 85.6 token/s MTP

Reddit r/LocalLLaMA ↗ · 5天前

在单张 RTX 5090 GPU 上使用 Qwen3.8:27b 模型,达到每秒 85.6 token 的性能。

0 人收藏 0 人点赞
#ai-inference

QWEN3.6-27B-MLX-8bit (29.5GIG) 非常出色

Reddit r/openclaw ↗ · 6天前

一位用户分享了他们切换到 QWEN3.6-27B-MLX-8bit 模型用于本地AI任务的经验,发现它在 Mac Studio 上节省了大量内存,同时表现与更大模型相当,提高了工作流程的稳定性。

0 人收藏 0 人点赞
#ai-inference

@ivanalog_com: 调试了一会儿,现在在Google A100上运行Qwen Flash的速度(3000+预填充,90+ tps)已经更快了…

X AI KOLs Timeline ↗ · 6天前 缓存

一个名为collabosm的GitHub仓库提供了一个优化设置,用于在Google Colab A100上运行Qwen3.8-Flash-Next模型,实现了比商业API更快的推理速度,并附有详细的性能指标和说明。

0 人收藏 0 人点赞
#ai-inference

@TheAhmadOsman: Mac Studio M5 Ultra 对比 2x DGX Spark 在 DeepSeek V4 Flash 上的表现 - DGX Sparks: 预填充快 2.41 倍(计算密集型) - Mac S…

X AI KOLs Timeline ↗ · 6天前 缓存

本文比较了 Apple 的 Mac Studio M5 Ultra 和两台 NVIDIA DGX Spark 在运行 DeepSeek V4 Flash 模型时的推理性能,显示 DGX Sparks 在预填充方面更快,而 Mac Studio 在生成方面略快。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈