标签
Rapid-MLX 0.11.0 带来了显著的性能提升,包括前缀缓存和响应缓存,支持新的模型家族,如 HY3 295B MoE 和 Qwen3-Coder-Next 80B,引入了结构化输出,确保有效的工具调用,并添加了与 MCP 服务器的无缝集成,用于自主代理工作流程。
Morph LLC描述了三种关键技术——基于编码输出训练投机模型、在廉价GPU上自动搜索内核、以及编写自定义互连——以大幅加速像Qwen和DeepSeek这样的开放模型在编码代理工作负载上的运行,实现了最高3倍的投机解码加速,并在7000美元的GPU上达到97-162 tok/s。
DeepSeek-Code-Whale 是一个开源的终端 AI 编程代理,专门为 DeepSeek 模型优化,支持 MCP 工具、Skills 扩展、前缀缓存优化(90% 缓存命中率)和 1M 上下文窗口,旨在降低 AI 编程成本并提供高效的命令行工作流。