@LottoLabs: https://x.com/LottoLabs/status/2064185127782232135
摘要
LocalMaxxing 是一个社区基准测试平台,用于本地 LLM 推理,帮助用户比较硬件、速度和配置。LottoLabs 团队阐述了他们的愿景,即通过更好的基准测试、评估和可访问的部署,使本地推理基础设施变得普遍。
查看缓存全文
缓存时间: 2026/06/09 14:51
为本地智能而生:我们的计划
每隔几代,就会有一层新的计算范式改变谁能够参与构建。开放系统、廉价存储、宽带、智能手机、云 API——每一层都扩大了访问权限、降低了摩擦,并创造了新的构建者群体。AI 是下一个层面,但前提是人们能够在自己的环境中真正运行、测量、信任并负担得起它。
这就是 LocalMaxxing 背后的理念。如今,LocalMaxxing 是一个面向本地大语言模型推理的社区基准测试平台,人们可以在这里追踪速度、比较硬件,并找到最适合自己的配置。它已经围绕每秒 token 数、硬件、显存使用量、推理引擎和可复现配置,组织了社区提交的基准测试结果,并且拥有专门用于评估和租赁的界面。
我们认为本地 AI 之所以重要,是因为计算能力不应被锁定在少数供应商、地区或定价模式之后。一个良好的 AI 生态系统应该让个人、实验室、初创公司和小团队能够在他们实际拥有的硬件上运行有用的模型,理解他们所做的权衡,并且无需请求许可就能参与其中。这意味着需要更好的性能可见性、更高质量的标准,以及更多将闲置计算能力和运维专业知识转化为可用基础设施的途径。
互联网让发布变得普及。本地 AI 可以让推理基础设施变得普及。但这只有在该技术栈足够清晰易懂,便于普通构建者导航时才能实现:哪个模型、哪种量化方式、哪个推理引擎、哪块 GPU、哪种内存配置、哪套评估、哪个端点、哪种成本结构。目前,这些知识有太多被分散在零散的 Discord 消息、基准测试截图、半可复现的代码仓库和个例性质的 X 推文中。
我们的计划是让本地推理更容易评估、更容易比较、更容易部署、更容易访问。
基准测试为先
首要工作是测量。LocalMaxxing 的存在是为了让本地大语言模型的性能变得清晰可读,它通过收集社区基准测试,帮助人们在 GPU、Apple Silicon、CPU、推理引擎和模型配置之间进行比较。这之所以重要,是因为本地推理并非一个只有一个答案的单一市场;而是一张在速度、质量、内存、成本、功耗、可复现性和运维复杂度之间权衡的矩阵。
一个快速的基准测试本身是不够的。我们希望基准测试结果能够锚定在使其有用的实际细节上:确切的硬件、推理引擎、量化方式、运行时参数,以及他人可以复现或分支的命令。当结果不仅令人印象深刻,而且具有可移植性时,本地推理才会变得更好。
随着时间的推移,我们希望 LocalMaxxing 成为本地模型在现实世界中实际表现情况的默认记录。不是理想化的供应商演示,不是孤立的合成截图,而是跨越混乱、异构、由社区运营的系统的真实记录。
有意义的评估
性能只是故事的一部分。一个快速但薄弱、脆弱或与工作负载不匹配的模型,实际上并不更好。这就是为什么评估是 LocalMaxxing 路线图的核心部分。
我们现在已有几个评估功能用于测试,能够存储完整的数据集和完整的评估跟踪。基础设施已经到位——下一步是扩展评估套件库,并使结果更具可操作性。
下一步是让评估在操作上更有用。我们希望评估能够回答实际问题,例如:哪种量化方式在我的硬件预算下表现最好?在给定的显存上限下,哪个模型最适合写代码?哪个推理引擎提供了最佳的质量/功耗比或质量/成本比?哪个本地部署的配置对于内部智能体、代码助手、支持工作流或批量文档处理来说是“足够好“的?这些都是构建者实际需要做出的决策。
更长远来看,我们认为最好的评估生态系统应当将公共标准基准测试与针对特定工作负载的狭窄测试相结合。广泛的套件有用,因为它们创造了一种共同语言;狭窄的套件有用,因为它们反映了人们在生产环境中真正关心的事情。LocalMaxxing 应该同时支持这两者。
CLI 路线图
如果基准测试让这个领域变得清晰可读,那么 CLI 应该让它变得可执行。一个强大的 LocalMaxxing CLI 可以将平台从人们浏览的网站转变为人们构建的基础设施。
CLI 的角色应该很简单:让它容易提交基准测试、运行评估、复现配置、比较结果,并将结果发布回共享索引。对于贡献者来说,这意味着更少的手动步骤和更标准化的元数据。对于团队来说,这意味着一条从本地实验到可重复基准测试工作流的路径。
CLI 路线图的一个良好初版可能如下所示:
-
基准测试提交,包含硬件检测、推理引擎元数据、模型标识符、量化标签和标准化的结果上传。
-
可复现运行,为常见推理引擎和模型格式生成命令或模板,以便人们可以重新运行已发布的配置。
-
评估执行,支持标准套件、自定义提示,以及通过 API 提交到共享排行榜。
-
结果比较,使用户能够对比两个模型、两种量化方式或两台机器在速度、质量和内存占用方面的差异。
-
自动化钩子,使实验室和高级用户能够通过现有 API 接口将 LocalMaxxing 集成到持续集成、定时测试或部署流水线中。
更深层次的目标不仅仅是方便。而是标准化。当本地 AI 工作流变得可脚本化、可复现和可共享时,整个生态系统的发展速度将大大加快。
市场和租赁
一个健康的本地 AI 生态系统不应当像云那样将“拥有计算资源的人“与“需要计算资源的人“截然分开。这里存在一个更开放市场的空间,社区拥有的硬件和运维专业知识可以按需获取。
LocalMaxxing 已经通过租赁功能开始朝这个方向迈进,社区托管的推理端点可以按每 1k 输出 token 定价出租,或免费提供。当前的展示表明,这可以包括专门的配置,例如在租赁期内配备直接操作员支持的集群式 Mac Studio 系统。
这种模式很重要,因为本地 AI 不仅仅关乎所有权,也关乎访问。一些用户想购买 GPU 并调优内核。其他人只想要一个值得信赖的端点,背后有了解技术栈的人支持。租赁可以通过使社区基础设施变得可发现来弥合这一差距,而无需迫使每个用户都成为全职基础设施运维人员。
下一步的演进是更完整的市场。在我们看来,这个市场最终应该在一个地方连接四样东西:
-
基准测试可信度,使买家能够了解端点或配置的实际性能。
-
评估可信度,使他们能够看到质量,而不仅仅是速度。
-
访问路径,包括租赁、托管端点,以及可能的打包部署服务。
-
供应侧参与,使运维人员能够列出硬件、管理好的技术栈或可复现的模板。
如果这一点能实现,LocalMaxxing 将不仅仅是一个排行榜。它将变成围绕本地推理的市场结构:比较、验证、租赁、部署和改进。
我们想要实现的目标
我们希望有一个未来,人们依赖的更多智能可以在离他们更近的地方运行:在他们的机器上、在他们的实验室里、在他们的公司内部、在租用的社区硬件上,或者在他们能够检查和控制的堆栈上。这样的未来更有利于韧性、更有利于可负担性、更有利于实验,因为它将能力分布开来,而不是集中起来。
我们还希望有一个未来,本地 AI 变得更容易信任。这需要透明的基准测试、共享的评估、可复现的配置以及可见的权衡。构建者应该能够回答一些基本问题——多快、多好、多贵、多可复现、多隐私——而不必依赖营销抽象。
从此刻开始的路线图在原则上很简单,尽管在执行上雄心勃勃:让基准测试更深入,让评估对决策更有用,让 CLI 成为一个真正的操作平台,让市场和租赁层足够有用,从而使社区基础设施能够真正流向需要它的地方。
本地 AI 不会因为意识形态而获胜。它会在更快、更便宜、足够隐私、足够可定制、并且足以解决实际问题的地方获胜。我们的工作是帮助人们看清这一点何时成立,用数据证明它,并让下一步变得显而易见。
TL;DR LocalMaxxing 将会变得更好,而不拉垮。
相似文章
@no_stp_on_snek: http://LocalMaxxing.com 众多提交中的第一个。
LocalMaxxing 是一个提供本地 LLM 推理社区基准测试的网站,让用户能够追踪速度并比较硬件性能。
为本地LLM提供大量答案的新旧基准测试
本文介绍了一个用于评估本地LLM配置的基准测试工具,重点关注显存使用情况、性能指标和硬件优化,以协助开发者优化配置。
本地模型优化(3 分钟阅读)
本文分析了在 MacBook Pro 上本地运行 AI 推理的可行性,对比了本地 Qwen 35B 模型与云端 Claude Opus 4.5。结论是,对于常规任务,本地模型速度快 2 倍,尽管在能力上略有差距,但仍是日常工作量中一半任务的实用选择。
@TheAhmadOsman: 本地AI现在很好了
Ahmad宣布了一个本地AI硬件竞技场,使用ODS在RTX PRO 6000、DGX Spark、Strix Halo、M5 MacBook Pro和ChatGPT等硬件上对LLM进行基准测试,并邀请社区为未来的比较提供意见。
@ItsmeAjayKV:过去7天我在家庭实验室运行的本地LLM分析。MoE模型现在统治了我的3090。使用最多的模型:@thinkymachine…
一位用户分享了在家庭实验室运行本地LLM的7天统计数据,指出MoE模型主导了其RTX 3090,其中Inkling-small和Ling-3.0-flash表现出色,并计划开源其仪表盘。