prefix-cache

标签

Cards List
#prefix-cache

@Raullen:Rapid-MLX 0.11.0 发布!让 Apple Silicon 上的本地模型可靠到足以运行你的代理工作流程,而不仅仅是演示…

X AI KOLs Following · 2天前 缓存

Rapid-MLX 0.11.0 带来了显著的性能提升,包括前缀缓存和响应缓存,支持新的模型家族,如 HY3 295B MoE 和 Qwen3-Coder-Next 80B,引入了结构化输出,确保有效的工具调用,并添加了与 MCP 服务器的无缝集成,用于自主代理工作流程。

0 人收藏 0 人点赞
#prefix-cache

优化模型以快速进行代码生成(8分钟阅读)

TLDR AI · 2026-06-22 缓存

Morph LLC描述了三种关键技术——基于编码输出训练投机模型、在廉价GPU上自动搜索内核、以及编写自定义互连——以大幅加速像Qwen和DeepSeek这样的开放模型在编码代理工作负载上的运行,实现了最高3倍的投机解码加速,并在7000美元的GPU上达到97-162 tok/s。

0 人收藏 0 人点赞
#prefix-cache

@wsl8297: 平时拿 DeepSeek 写代码的人,可以看看 DeepSeek-Code-Whale。 GitHub:https://github.com/usewhale/DeepSeek-Code-Whale… 开源终端 AI 编程 Agent,专…

X AI KOLs Timeline · 2026-05-23 缓存

DeepSeek-Code-Whale 是一个开源的终端 AI 编程代理,专门为 DeepSeek 模型优化,支持 MCP 工具、Skills 扩展、前缀缓存优化(90% 缓存命中率)和 1M 上下文窗口,旨在降低 AI 编程成本并提供高效的命令行工作流。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈