llm-performance

标签

Cards List
#llm-performance

@DavidFSWD: 本周本地AI最惊人的事是这个优化过的Qwen 3.8模型:ukisai/Swift-1.5-Qwen3.8-27B-GSQ-RCO-GGUF…

X AI KOLs Timeline ↗ · 6天前 缓存

这条推文强调了一个优化版本的Qwen 3.8模型,该模型可以在显存低于16GB的本地硬件上高效运行,在较旧的GPU配置上达到30-80个令牌每秒的速度。

0 人收藏 0 人点赞
#llm-performance

@wafer_ai: Wafer 在延迟方面胜过 Cerebras,服务于 @ycombinator 的 AI Office Hours。GLM-5.2 在 Wafer 上平均延迟 379 毫秒,而 G… 为 674 毫秒。

X AI KOLs Following ↗ · 2026-09-25 缓存

Wafer 在 YC 的 AI Office Hours 中延迟表现优于 Cerebras,GLM-5.2 达到 379 毫秒,而 Gemma 4 为 674 毫秒,使得延迟降低 44%,并提升了用户参与度。

0 人收藏 0 人点赞
#llm-performance

@no_stp_on_snek: 精彩视频 @digitalix 。苹果的新小烤箱真是个性能怪兽!https://youtu.be/c_58D7ixOQI 现在得考虑卖哪个肾了……

X AI KOLs Following ↗ · 2026-09-23 缓存

苹果的M5 Ultra芯片与M3 Ultra相比,本地LLM的token生成速度提升高达1.5倍,提示处理速度提升4倍,内存带宽和存储速度有所提升,但代价高昂。

0 人收藏 0 人点赞
#llm-performance

使用两张RTX Pro升级了我的本地设置,效果惊人。

Reddit r/LocalLLaMA ↗ · 2026-09-16

一位软件开发者分享了使用两张RTX Pro GPU升级本地设置的经验,包括解决电源问题、实现高性能运行Qwen和Deepseek等LLM。他们讨论了配置细节,并寻求优化和模型建议。

0 人收藏 0 人点赞
#llm-performance

@dongxi_nlp:LLM 的速度涉及两种体验:开始响应所需的时间,以及响应是否…

X AI KOLs Timeline ↗ · 2026-09-15 缓存

本文解释了 LLM 响应速度的两个关键指标:与预填充相关的时间到第一个 Token(TTFT),以及与解码相关的 Token 间延迟(ITL),影响响应性和流畅度。

0 人收藏 0 人点赞
#llm-performance

Nex-N2.5-mini-MLX-4bit 在 Apple M5 Max 上 — 133.6 tok/s — llm-bench.io

Reddit r/LocalLLaMA ↗ · 2026-09-12 缓存

Nex-N2.5-mini-MLX-4bit 模型在 Apple M5 Max 硬件上的基准测试结果,生成速度达到 133.6 tokens/s,研究任务中的质量分数高达 85.80。

0 人收藏 0 人点赞
#llm-performance

3.8-27B让我对3.5/3.6-35B彻底失望了。它简直*荒谬地*优越。

Reddit r/LocalLLaMA ↗ · 2026-09-12

作者赞扬了3.8-27B AI模型相比3.5/3.6-35B等其他模型的卓越性能和效率,强调了它在复现项目中的细节关注度和较低的令牌使用量。

0 人收藏 0 人点赞
#llm-performance

运行GPT-6 Astra于专家级医疗知识基准测试。得分87.4%,超越所有其他大语言模型

Reddit r/ArtificialInteligence ↗ · 2026-09-10

GPT-6 Astra在MedXpertQA医疗基准测试中得分87.4%,超越所有其他大语言模型,并标志着与两年前GPT-4o的42.8%得分相比有显著提升。

0 人收藏 0 人点赞
#llm-performance

MoE卸载技术——Intel与AMD CPU指令集差异解析

Reddit r/LocalLLaMA ↗ · 2026-09-08

本文探讨了在大型语言模型推理场景下Intel与AMD CPU的性能差异,分析了指令集及内存带宽对卸载速度的影响。

0 人收藏 0 人点赞
#llm-performance

CyrillicQA:语音编码秘密语言对LLM性能的影响

arXiv cs.CL ↗ · 2026-08-25 缓存

本文研究大型语言模型(LLMs)是否能够对语音编码的语言进行解码,例如用西里尔字母书写的德语,以评估其在标准拉丁字母训练数据之外的抽象能力和性能。

0 人收藏 0 人点赞
#llm-performance

Ornith-1.5-35B-A3B Q4 在 4070Ti 上运行速度达 60 tok/s。

Reddit r/LocalLLaMA ↗ · 2026-08-20

一位用户报告在 NVIDIA RTX 4070 Ti 上使用 Ornith-1.5-35B-A3B MOE 模型达到了每秒 60 个令牌的速度,展示了高效的本地推理优化。

0 人收藏 0 人点赞
#llm-performance

我现在(主要)根据速度而非智能来挑选模型

Lobsters Hottest ↗ · 2026-08-02 缓存

作者认为前沿大语言模型已经达到了“足够好”的智能门槛,因此现在选择模型时更看重速度而非原始智能,并举例说像GLM5.2和DeepSeek V4 Flash这样快速的开源权重模型已成为日常主力。

0 人收藏 0 人点赞
#llm-performance

10 tokens per second 到底有多快?

Simon Willison's Blog ↗ · 2026-05-20 缓存

Simon Willison 探讨了 10 tokens per second 速度对于大型语言模型的实际意义,提供了关于这种速度感觉有多快以及其对可用性的影响的背景信息。

0 人收藏 0 人点赞
#llm-performance

立场:让我们开发数据探针,从根本上理解数据如何影响LLM性能

arXiv cs.AI ↗ · 2026-05-20 缓存

这篇立场论文主张开发‘数据探针’——来自随机过程的合成序列——以系统性地研究数据特征如何影响LLM性能,旨在超越经验启发式方法。

0 人收藏 0 人点赞
#llm-performance

@ClementDelangue:笔记本上本地开放权重 AI 的进步速度已超过摩尔定律的两倍!从 2024 年 5 月到 202…

X AI KOLs Following ↗ · 2026-05-11

Hugging Face CEO Clement Delangue 表示,在硬件配置不变的情况下,笔记本端本地开放权重 AI 的性能提升速度已达摩尔定律的 4.7 倍,并以模型从 Llama 3 70B 演进至 DeepSeek V4 Flash 的进展作为佐证。

0 人收藏 0 人点赞
#llm-performance

@davis7:@0xSero 帮我把本地模型配置好了,我没想到它们现在竟然这么强大了。这算是前沿(frontier)级别了吗……

X AI KOLs Following ↗ · 2026-05-09

作者强调了在 RTX 5090 上本地运行开源 Qwen 3.6-27B 模型的卓越能力,指出其在编程任务上的强劲表现,并与商业模型进行了对比,尽管本地部署过程颇具挑战性。

0 人收藏 0 人点赞
#llm-performance

@GigaAI: 推出幻觉纠正功能。我们将幻觉率降低了70%。Giga的幻觉率约为1%。更胜一筹……

X AI KOLs Timeline ↗ · 2026-05-07 缓存

GigaAI 宣布推出新的幻觉纠正功能,将模型的幻觉率降至约1%,并声称其可靠性优于前沿模型。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈