无需拥有八块GPU即可完整使用1M上下文的V4-Flash
摘要
本文介绍了Gonka,一个去中心化的推理网络,允许通过OpenAI兼容接口访问具有完整1M上下文的V4-Flash AI模型,无需本地GPU所有权。
披露:由Gonka贡献者发布。对于这个子版块,V4-Flash的实际问题是:在1M窗口下拥有284B参数。这里大多数人无法运行它,而能运行的量化版本放弃了大部分上下文,这通常是该模型最初有趣的原因。Gonka是一个去中心化的推理网络,在独立的GPU主机上提供完整的上下文窗口下的V4-Flash服务。兼容OpenAI,因此只需在Ollama、LM Studio、Cline或任何其他已使用的工具中更换基础URL。访问通过社区代理进行,代理接受普通支付,因此不涉及钱包和链上交互。这不是在推销停止本地运行。本地运行更快、更私密、边际成本为零,对于任何适合的模型,它在这三方面都胜出。这是针对模型不适合本地运行的情况,而替代方案是集中式端点或无。在这一差距中的不同之处:供应来自独立运营商,而非像其他人一样转售相同的云服务,因此价格行为不同,并且设置中没有任何东西造成锁定。代码是开源的,包括协调层:https://github.com/gonka-ai/gonka 端点:https://gonka.ai Discord:https://discord.gg/ex3dw4wB 欢迎提问任何问题,包括它表现不佳的地方。
相似文章
GLM-5.3-Flash @ DGX Station GB300: 约206 tokens/秒(单流),1M上下文
用户在DGX Station上对GLM-5.3-Flash AI模型进行基准测试,实现了约206 tokens/秒的单流推理速度,上下文窗口为100万,并分享了设置的Docker命令。
Z.ai 完全在中国AI芯片上运行GLM-5.3-Flash
Z.ai宣布,其完全在中国AI芯片上运行了GLM-5.3-Flash模型,每个token的成本与Nvidia GPU相当,并使用了一个针对内存受限硬件优化的自定义推理引擎。
@dee_hw:在本地以 300 tok/s 的速度运行前沿模型是什么体验?Autonomous Computer × DeepSeek V4 Flash 现在是我的日常主力……
一条推文和产品页面,推广 Autonomous Computer 2——一款配备双 RTX 5090 GPU 的本地 AI 工作站,旨在高速运行 DeepSeek V4 Flash 等前沿模型,同时保护隐私且无需按 token 付费。
Qwen3.8-Flash-Next 在单张96 GB显卡上支持170K上下文窗口,速度约110 tokens/秒。
本文介绍了一种使用量化n-gram运行Qwen3.8-Flash-Next模型的方法,可在单张96GB显卡上实现超过17万token的上下文长度。通过INT4量化技术配合内存映射磁盘访问,处理速度最高可达每秒110个token。
@Saboo_Shubham_:开源 AI 势头强劲。DeepSeek v4 Flash 是一款准前沿模型,拥有高达 100 万的上下文窗口。它可本地…
文章重点介绍了 DeepSeek v4 Flash,这是一款拥有 100 万上下文窗口的准前沿开源模型,并指出其能够通过 2 比特量化在 128GB 内存的 Mac 上本地运行。