本地LLM社区感觉就像互联网的黄金时代再次重现
摘要
本文反思了本地LLM社区中的硬件短缺如何推动实践优化和学习,唤起早期互联网时代的感觉,与当今容易分心的主流文化形成对比。
最近由于当前的硬件短缺,不幸或幸运的是,我们无法简单地将无限的云计算投入到问题中,而是被迫真正关注底层发生了什么。我们正在调整推理引擎、学习量化数学,并优化架构,只为在最低配置下挤出尽可能多的性能。事实:就在最近,分叉的llama.cpp(s)和Strix Halo的halogen-flash-server将性能推至顶峰,为Qwen 3.8 Flash Next (Q38FN)实现了双倍解码性能(52 tok/s),预填充性能提升5-6倍(1300 tok/s),而Q38FN本身是另一个巨大的架构改进,带有Engram,使其不仅小巧而且智能。我仍然记得在硬件短缺之前,作为一个喜欢调整和优化的人,人们只是告诉我停止,调整是愚蠢的,就买更多RAM、买更多GPU... 这让我想起了早期的网络... 当时设置一台机器或托管一个服务器意味着挖掘论坛帖子、在IRC上故障排除,并自由分享自定义脚本只是为了让事情正常工作。那个时代不仅培养了程序员;它还构建了从裸机到上层全面理解堆栈的超级多才多艺的端到端思考者。对比一下主流网络文化的最终走向。如今大多数平台如Tiktok、Facebook、Youtube... 都是为了无摩擦的末日滚动而设计的... 无尽的短视频流旨在让我们分心并浪费时间。我们被便利过度宠坏了。我的观点是:当我们拥有太少时,我们试图学习更多;当我们拥有太多时,我们分心并学习太少。这是我们本地LLM社区的黄金时代,让我们学习并进步!
相似文章
本地大语言模型已不再民主...硬件门槛已失控。
作者认为,由于硬件成本高昂,运行本地大语言模型已变得难以企及,这与早期消费级GPU尚能胜任的情况形成鲜明对比,并对看似不再民主的访问权表达了不满。
如果你对本地LLM感兴趣,从爱好学习角度出发,切勿让FOMO占上风
本文建议对本地LLM感兴趣的爱好者避免FOMO和不必要的开支,强调学习可以通过最少资源实现,且该技术仍在发展中。
专家级新手和独狼将主导早期LLM时代
作者反思了本地LLM(GPT-OSS 20B、Qwen3 Coder 30B)如何帮助他将博客从Drupal迁移到静态站点,并将其比作快速交付代码但需要审查的初级开发人员。他认为,'专家级新手'和'独狼'将在早期LLM时代蓬勃发展。
本地LLM伙伴
一位拥有45年经验的开发者正在构建一个本地优先的LLM框架,包含多智能体逻辑,即将在GitHub上开源,并向社区询问哪些功能能改善他们的本地LLM体验。
LLM时代的可扩展软件
本文讨论了LLM如何在Web上开启可扩展软件的新时代,使用户能够通过诸如‘Small Software’和‘LLM-native software’等概念,创建个性化应用并满足长尾需求。