标签
DeepSeek官方宣布API价格大幅上调,在推出DeepSeek-V4-Flash-0731后不久,便结束了以超低价格访问接近前沿模型的时代。
详细测试和调优,以在RTX 3090上优化GGUF格式的DeepSeek-V4-Flash-0731,通过不同的量化和加载参数,在128K上下文下达到约15 tok/s。
对DeepSeek突然无预警上调API价格的评论,强调了生产构建需要时间调整或更换供应商这一痛点。
这条推文指出彭博社的AI模型定价图遗漏了DeepSeek,因为DeepSeek V4 Flash的定价极低(输入$0.14/百万token,输出$0.28),放在图中会让其他模型显得处于“死亡区”。
作者评论DeepSeek V4 Flash降价,认为这能让更多厂商活下去,并调侃称大模型厂商该叫梁文峰为“梁圣”。
推文讨论DeepSeek即将涨价的传闻,猜测是否因用户热情过高导致算力紧张,进而影响其AGI核心目标。
DeepSeek 官方宣布即将大幅涨价,用户感叹低价时代结束。
用户询问通过 Colibri 运行 Deepseek V4 Flash 的性能数据,重点关注高 VRAM 配置、长上下文预填充以及面向智能体工作负载的 token 生成速度。
作者观察到闭源与开源 AI 模型之间的差距正在缩小,并将闭源水平下降以与开源社区接轨归功于 DeepSeek V4 Flash 和 Kimi K3。
有人将 Kimi PPT 逆向成了开源 skill,可使用 DeepSeek 等模型低成本生成高质量 PPT,支持编辑和导出 PPTX。
jabbatheduck 发布了 REAP 专家剪枝后的 DeepSeek-V4-Flash 检查点的 GGUF 量化版本,为消费级 GPU 上的内存受限推理进行了大幅压缩,同时保留了路由器和注意力的精度。
DeepSeek V4 Flash 已成为 Ollama 在 token 使用量上增长最快的模型,并且是本周 OpenRouter 上最受欢迎的模型,现在可通过多个提供商在 Pi 中使用。
分析梁文锋早期微博,认为他敢于冒险、能承受风险并走出无人区,是他后来成功创办DeepSeek并取得突破的关键原因。
讨论Transformer做大规模推理的瓶颈,并梳理2023到2026年间大模型推理优化技术的演进,包括KV cache量化、推测解码、架构创新和软硬件协同设计。
讨论Codex在X和海外市场逐渐形成垄断趋势,以及类如Kimi CLI、ZCode、Grok Build等其他框架的生存空间越来越小。
有用户报告称,将 CUDA 从 13.2 更新到 13.3 可以修复 DeepSeek V4 Flash 0731 的循环问题,使模型在长编码任务中重新可用。