model-inference

标签

Cards List
#model-inference

模型填补空白,无人赋予其此权限。

Reddit r/AI_Agents · 4天前

本文讨论了AI模型在智能体系统中推断缺失数据的风险,可能导致未授权执行,并提出将决策权限与模型分离,以确保仅执行明确声明的指令。

0 人收藏 0 人点赞
#model-inference

双 AMD Radeon AI Pro R9700 或双 NVIDIA RTX 3090。

Reddit r/LocalLLaMA · 2026-09-15

作者正在构建一个双 GPU 系统,用于运行大型语言模型,评估 AMD Radeon AI Pro R9700 与 NVIDIA RTX 3090 选项,同时旨在降低 AI 订阅成本。

0 人收藏 0 人点赞
#model-inference

别错过EXL3量化技术

Reddit r/LocalLLaMA · 2026-08-30

作者分享了在12GB显存GPU上运行使用EXL3量化的30B参数模型的经验,实现了编码和代理任务的高效性能和速度。

0 人收藏 0 人点赞
#model-inference

难以置信!我使用llama.cpp中的mmap函数,将Qwen3.8-Flash-Next IQ3_XSS放入16G+64G RAM中,速度仍达到26t/s。

Reddit r/LocalLLaMA · 2026-08-28

用户成功使用llama.cpp中的mmap函数,将Qwen3.8-Flash-Next IQ3_XSS模型放入16GB+64GB RAM中,达到26 tokens/秒的速度,这超过了更大的非MOE 30B模型。

0 人收藏 0 人点赞
#model-inference

在4070 Ti + 32GB RAM上测试极限MoE模型的性能:Kimi K3、DeepSeek V4 Flash和Qwen3.5-122B的结果及研究论文🔧

Reddit r/LocalLLaMA · 2026-08-25

本文详细介绍了使用自定义运行时CRANE V2在消费级硬件上进行的极限混合专家模型实验,并展示了包含Kimi K3、DeepSeek V4 Flash和Qwen3.5-122B模型结果的研究论文。

0 人收藏 0 人点赞
#model-inference

@no_stp_on_snek: 看看Buun的工作,他在大展身手。

X AI KOLs Following · 2026-08-19 缓存

一位用户突出了Buun在优化AI模型方面的工作,实现了在单张3090 GPU上对Qwen 3.6的高速推理,并为Qwen 3.8开发了DFlash2。

0 人收藏 0 人点赞
#model-inference

Qwen 3.8 27b搭配DeepSeek Harness令人惊叹!!目前体验与性能。

Reddit r/LocalLLaMA · 2026-08-16

用户分享了使用Qwen 3.8 27b模型搭配DeepSeek Harness的积极体验,赞扬其稳定性和长上下文处理能力,但提到速度限制,并期待未来的模型发布。

0 人收藏 0 人点赞
#model-inference

@TheAhmadOsman: 预测我们将在不到18个月内,在单张RTX PRO 6000上获得与Kimi K3相当的智能 如何?…

X AI KOLs Following · 2026-08-15 缓存

一位Twitter用户预测,与Kimi K3相当的AI智能将在18个月内运行在单张RTX PRO 6000 GPU上,并后来指出Opus 4.6 Max的质量已经可以在单张RTX 5090上运行。

0 人收藏 0 人点赞
#model-inference

@victormustar: 我为 Qwen3.8-27B 部署了免费公共端点,无需令牌,兼容 OpenAI,轻速率限制。由 Hug… 提供支持。

X AI KOLs Following · 2026-08-15 缓存

已为 Qwen3.8-27B AI 模型部署免费公共端点,提供兼容 OpenAI 的 API,支持视觉、工具调用和大型上下文窗口,由 Hugging Face Inference Endpoints 提供支持,至少在线 72 小时。

0 人收藏 0 人点赞
#model-inference

@TheAhmadOsman: 我在2023年构建了这款AI服务器,专为Qwen 3.8 27B等模型设计

X AI KOLs Timeline · 2026-08-15

一位用户在2023年构建了一款专门用于运行Qwen 3.8 27B等模型的AI服务器。

0 人收藏 0 人点赞
#model-inference

我使用ARM64汇编语言从头实现了YOLO26n模型推理(无框架)[P]

Reddit r/MachineLearning · 2026-07-26

作者使用ARM64汇编语言从头实现了YOLO26n模型推理,没有使用任何外部框架,展示了底层AI推理技术。

0 人收藏 0 人点赞
#model-inference

@DanKornas: 当推理、模型配置和集成路径集中在一处时,构建视频生成工作流程会更加容易。L…

X AI KOLs Timeline · 2026-07-24 缓存

LTX-Video 是 Lightricks 开发的一个开源 Python 仓库,用于在本地使用 LTX-Video 模型生成和调节视频,支持文本/图像输入、多条件工作流程,并与 ComfyUI 和 Diffusers 集成。

0 人收藏 0 人点赞
#model-inference

@Youssofal_: 在搭载M5 Max的Macbook Pro上,Qwen 3.6 27B模型达到72+ TPS。MTPLX V2现已发布!在MLX上运行模型的最快方式。

X AI KOLs Following · 2026-07-07 缓存

MTPLX V2已发布,声称在搭载M5 Max的Macbook Pro上通过MLX运行Qwen 3.6 27B模型时每秒可处理72+ tokens。

0 人收藏 0 人点赞
#model-inference

@yishan: Meta 真的搞砸了这个人。

X AI KOLs Timeline · 2026-07-07 缓存

John Carmack 评论了关于AI加速器的内存成本和容量问题,指出模型推理可以有确定性的内存访问模式,这与游戏渲染形成对比。

0 人收藏 0 人点赞
#model-inference

DFlash 支持已合并到 llama.cpp

Reddit r/LocalLLaMA · 2026-06-28 缓存

DFlash 支持已合并到 llama.cpp,提升了兼容模型的推理性能。

0 人收藏 0 人点赞
#model-inference

48GB VRAM + Qwen 3.6 27B 的最佳设置

Reddit r/LocalLLaMA · 2026-06-20

一位用户分享了在双GPU配置(RTX 4090 + RTX 3090)上使用llama.cpp运行Qwen3.6 27B (Q8_0)的优化设置,在250k上下文下实现了75-100 t/s和1500 pp。

0 人收藏 0 人点赞
#model-inference

给机子加了一张旧2070 Super后,我回不去了……更糟糕的是,我现在需要更多

Reddit r/LocalLLaMA · 2026-05-31

一位用户分享了将旧款 NVIDIA 2070 Super GPU 添加到机子中以获得额外 VRAM 的经验,使其能够以高量化和上下文大小运行像 Qwen3.6-27B 这样的更大模型,且性能良好,现在正考虑升级到 3090 以获得更多 VRAM。

0 人收藏 0 人点赞
#model-inference

qwen3.6-35b-a3b-mtp 在 GTX 1060 6GB 上运行

Reddit r/LocalLLaMA · 2026-05-24

一位用户成功在一台使用十年的旧工作站上(配备 GTX 1060 6GB),在 Windows 上使用 LMStudio 运行了 Qwen3.6-35B-a3b-MTP 模型,实现了可接受的聊天速度。

0 人收藏 0 人点赞
#model-inference

Qwen3.6-35B-A3B Q4 262k上下文,8GB 3070 Ti上可达+30tps

Reddit r/LocalLLaMA · 2026-05-22

作者分享了在8GB RTX 3070 Ti上使用llama.cpp运行Qwen3.6-35B-A3B MoE模型,实现高达262k上下文、30+tps的详细调优技巧,并指出从Windows切换到Ubuntu Server后速度提升了25%。

0 人收藏 0 人点赞
#model-inference

寻找早期用户试用我们的 OpenClaw 模型方案,并告诉我们哪里有问题(15-30 分钟)

Reddit r/openclaw · 2026-05-20

OpenClaw 正在寻找早期用户测试其开源模型推理方案,该方案按并发槽位销售,具有高吞吐量且无共享池,以换取免费使用和反馈。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈