无需拥有八块GPU即可完整使用1M上下文的V4-Flash

Reddit r/ArtificialInteligence 新闻

摘要

本文介绍了Gonka,一个去中心化的推理网络,允许通过OpenAI兼容接口访问具有完整1M上下文的V4-Flash AI模型,无需本地GPU所有权。

披露:由Gonka贡献者发布。对于这个子版块,V4-Flash的实际问题是:在1M窗口下拥有284B参数。这里大多数人无法运行它,而能运行的量化版本放弃了大部分上下文,这通常是该模型最初有趣的原因。Gonka是一个去中心化的推理网络,在独立的GPU主机上提供完整的上下文窗口下的V4-Flash服务。兼容OpenAI,因此只需在Ollama、LM Studio、Cline或任何其他已使用的工具中更换基础URL。访问通过社区代理进行,代理接受普通支付,因此不涉及钱包和链上交互。这不是在推销停止本地运行。本地运行更快、更私密、边际成本为零,对于任何适合的模型,它在这三方面都胜出。这是针对模型不适合本地运行的情况,而替代方案是集中式端点或无。在这一差距中的不同之处:供应来自独立运营商,而非像其他人一样转售相同的云服务,因此价格行为不同,并且设置中没有任何东西造成锁定。代码是开源的,包括协调层:https://github.com/gonka-ai/gonka 端点:https://gonka.ai Discord:https://discord.gg/ex3dw4wB 欢迎提问任何问题,包括它表现不佳的地方。
查看原文

相似文章

Z.ai 完全在中国AI芯片上运行GLM-5.3-Flash

Reddit r/singularity

Z.ai宣布,其完全在中国AI芯片上运行了GLM-5.3-Flash模型,每个token的成本与Nvidia GPU相当,并使用了一个针对内存受限硬件优化的自定义推理引擎。