标签
一名用户成功运行了 Qwen 3.8 27B AI 模型在 RTX 3060 和 5060 Ti GPU 的混合设置上,使用 exllamav3 的张量并行技术,在启用 MTP 的情况下达到约每秒 50 个令牌的速度。
在 RTX 5090 上实时运行 Qwen 3.8 27B 模型以解决覆盖设计数学问题的实验,展示了开源 AI 在消费级硬件上推动科学创新的潜力。
一篇推文讨论了在配备24 GB RAM的MacBook上本地运行无审查版Ternary-Bonsai-27B AI模型,突出其在编码任务中的性能。
Deltafin是一款开源工具,使得能够在像MacBook Pro这样的消费级硬件上运行完整的Kimi K3 2.8T参数模型,通过从固态硬盘流式传输数据,实现约每秒1个token的性能。
OUI-1 是全球首款用于 Generative UI 的模型,一个经过微调的 DiffusionGemma,能够以速度和可靠性在消费硬件上生成用户界面。
一条推文认为,消费硬件需要高日活跃使用率,以便用户维持订阅并保持设备充电,Oura Ring 是一个成功案例,拥有强劲的 DAU/MAU 比率。
Qwen3.8-27B 的微调版本,显著减少了思考令牌数量,同时在 ARC-C 和 ARC-E 等关键 AI 基准测试上超越了其他模型,针对消费级硬件进行了优化。
一位用户分享了在配备6GB显存和16GB内存的系统上使用llama.cpp运行Qwen 3.8 flash next模型的体验,通过1位量化实现了6-7个每秒的生成速度,并寻求量化变体的推荐。
本文对 llama.cpp 和 ik_llama.cpp 在双 RTX 3060 硬件上运行 Qwen3.8-Flash-Next 模型进行基准测试,展示了优化 tensor splitting 和 ubatch 设置可以将预填充速度从 36 t/s 大幅提升至 400 t/s,并对比了 RAM 使用情况。
本文对iPhone 17 Pro上的AI推理性能进行基准测试,评估了生成时间、模型智能等指标在各种任务中的表现,以评估现实世界移动设备的使用情况。
本文详细介绍了使用自定义运行时CRANE V2在消费级硬件上进行的极限混合专家模型实验,并展示了包含Kimi K3、DeepSeek V4 Flash和Qwen3.5-122B模型结果的研究论文。
这条推文强调了 DeepSeek-V4-Flash 在 Mac M5 Pro 上以每秒 5.71 个 token 的速率运行,突显了消费级硬件上本地 AI 推理的进步,并提到了腾讯的开源 Palm-Infra 用于 Apple Silicon 优化。
FreeToken is an open-source local inference engine designed to run large Mixture-of-Experts (MoE) models on consumer-grade computers, offering significantly faster performance than alternatives like Ollama with easy installation and native GUI.
本文赞扬Qwen3.8-27b在执行复杂多步骤任务时展现出的卓越自主性,它无需人工干预即可进行多次工具调用,并且所有操作都在消费级硬件如RTX 3090上本地运行。
本文讨论了Qwen3.8 2.4T开放权重模型的发布,展示了其用于创建Call of Duty克隆游戏,并强调了27B模型在消费级硬件上的可用性,从而促进了本地AI应用的机会。
一个实验,使用 llama.cpp 在双消费级 GPU(RTX 5090 + 5060 Ti)上本地运行 Qwen3.8-2.4T-A95B MoE 模型,启用 MTP 推测解码后达到约 0.8 tok/s。
据报道,OpenAI正在开发一款冰球大小的消费设备,售价超过300美元,标志着其正式进军专用硬件领域。
介绍 Iris Ai,一个在消费级硬件上将查询路由至8个专用LLM的系统,通过每次仅激活一个模型和动态模型交换,以低内存实现大模型性能。
一位用户对在配备24GB显存的中端Windows PC上通过量化运行前沿模型DeepSeek-V4-Flash-0731表示震惊,凸显了本地AI的飞速进步。