标签
基于个人在Qwen 27B 3.8上的经验,建议增加llama.cpp的-cram参数,以在长上下文的代理工作流中获得更好性能。
本文介绍了一项开源研究,通过基准测试和原生批处理、MLX量化等技术优化本地视觉语言模型的延迟,在Apple硬件上实现显著加速的同时保持决策准确性。
在为期两周的冲刺中,团队使用内部 Claude 模型,将 claude.ai 和桌面应用上的关键用户旅程速度提升了 3 倍,显著减少了等待时间,且未发生任何面向客户的事件。
自适应无损浮点(ALP)编码是一种针对 Apache Parquet 中浮点数据的新轻量级编码,提供与 zstd 相似的压缩比,同时具有更快的解压速度、随机访问支持以及对 GPU/SIMD 友好的解码。
Modal 详细介绍了他们如何为万亿参数编码代理优化推理性能,为其服务在吞吐量和交互性方面实现了显著提升。
本文介绍了一种剪枝Whisper ASR模型编码器层的方法,将编码器大小减少18.5%,并通过无标签数据蒸馏恢复性能,同时发布了代码和预训练模型供采用。
Halogen 版本 0.12.0 修复了高上下文深度下的性能下降问题,展示了在 AMD Ryzen AI Max+ 硬件上,Qwen3.8-Flash-Next 在 100万令牌上下文时的解码和预填充速度的提升。
本文提出Cache-to-Cache(C2C)这一新范式,利用KV-Cache实现大型语言模型之间的直接语义通信,相比基于文本的方法,能提升响应质量并减少延迟。
本文解释了在大语言模型(LLM)推理过程中GPU内存的使用方式,将其分解为四个关键组件:模型权重、KV缓存、激活值/工作区和运行时开销。文章强调了量化在优化内存使用以提升性能方面的重要性。
Go 1.27 引入尺寸特化内存分配,适用于80字节及以下的分配,将分配速度提升20-30%,并提升分配密集型代码的整体程序性能最多1%。
演示了将Qwen3.8-Flash-Next模型的KV缓存卸载至系统内存的技术,通过利用该模型高效架构,可在最大程度减少解码速度下降的情况下支持长上下文推理。
Polymarket已构建内部索引系统,由Rust编写的rindexer提供支持,实现了交易、头寸和余额的近实时更新,链上数据事件处理速度提升多达28秒。
ChatGPT的共同发明者宣布发布名为Jev的新AI模型,采用RLCD训练,声称其速度快20-200倍,成本低40-400倍(输出代币免费),并针对可组合智能进行了优化,作为通往AGI的路径。
在采用 slotstream 技术的低内存设备上运行 MoE 模型时,专家前瞻技术的实现带来了超过 10% 的性能提升,修正模型还能带来额外的增益。
此拉取请求为 ggml-cuda 的 HIP 添加缺失的 AMD GCN MMQ 配置,增强了 llama.cpp 推理库中 RDNA2 GPU(如 MI50 和 MI60)的预填充性能。
DSPy 3.4 候选版本已宣布,正从 litellm 迁移以提升导入速度并减少依赖。社区成员如 Drew Breunig 对改进表示赞赏。
在苹果 M3 神经引擎中,当权重大小为 1 MiB 的倍数时,发现了性能节流问题,导致吞吐量下降。通过避开有问题的 DMA 路径,Llama 3.2 和 Qwen3-8B 等模型的 token 吞吐量得到了显著改善。
一位作者改进了 M3 Ultra Studio 上的 MLX 性能,使 4 位量化的 Qwen3.8-Flash-Next 模型达到 73 tok/s,其智能评分与 GPT-5.6 Sol 相当,凸显了本地 AI 日益增长的潜力。
Swift-Qwen3.8-27B 是 UkisAI 基于 Qwen3.8-27B 开发的推理高效版本,可将思考令牌减少 58.3%,同时保持几乎相同的性能。
作者们用纯 JAX 创建了一个轻量级、高性能的异步强化学习堆栈,分享了一份关于推理、RDMA 权重传输、内存优化以及用于扩展 RL 系统的分片的见解的工作日志。