标签
此拉取请求使得在使用Vulkan后端时,llama.cpp中的张量并行(TP)变得可行,从而能够在多个GPU上进行分布式推理。
Bun 有一个开放的拉取请求,为 JavaScriptCore(WebKit 底层的 JavaScript 引擎)添加共享内存线程支持。这一增强可能提高 Bun 中多线程 JavaScript 工作负载的性能。
今天 Devin 获得了一次重大的安全升级,使其能够以安全工程师的深度审查每一次拉取请求。
一位来自苹果的开发者向 Godot 提交了一个带有 AI 使用说明的拉取请求,推文作者对此表示赞赏,并建议在开源贡献中采用这种做法。
针对 llama.cpp 的拉取请求 #24080 增加了 UI/svg 块渲染,增强了项目的界面能力。
一个对 vLLM 的拉取请求为 MiniMax M3 增加了张量并行度 3 的支持(使用其 NVFP4 量化),使得该模型可以在 3 台 DGX Sparks(每台 87GB 显存)上运行。
这条推文推广了Devin,一款在云端自主工作的AI编程工具,无需用户监督即可生成pull request,并附有教程视频链接。
此拉取请求为 llama.cpp 添加了 cohere2-MoE 模型的架构支持,实现了对该混合专家模型(Mixture of Experts)的推理。
一个针对 llama.cpp 的拉取请求,移除了多令牌预测 (MTP) 中的填充和多重设备到设备拷贝,提高了 GPU 上的性能。
本拉取请求为 llama.cpp 添加了视频输入支持,使多模态模型能够通过新的 mtmd 组件处理视频数据。
ggerganov的此pull request优化了llama.cpp中的kv-cache,以避免不必要的kv cells复制,从而提升推理性能。这是对开源LLM推理库llama.cpp的一个贡献。
一个针对 llama.cpp 的拉取请求,将多列 MMVQ 从 CUDA 移植到 SYCL,在 Intel Arc GPU 上实现了约 45% 的推测解码加速。
此拉取请求为 llama.cpp(一个开源 LLM 推理引擎)增加了对 Granite4 Vision 模型的支持。
新增在聊天中渲染Mermaid图表的功能,并在llama.cpp网页界面中提供交互预览。
为 llama.cpp 添加 StepFun 3.5 MTP 模型支持的拉取请求。
llama.cpp 是一个开源的 LLM 推理引擎,使用 C/C++ 编写,依赖极少,支持多种硬件和量化方法。此拉取请求限制了 llama_context 的最大输出数。
Peter Steinberger利用Codex构建了全自动QA机器人,每次代码提交后自动生成测试、运行测试,并能在发现bug时自动修复并提交PR,大幅提升开发效率。
此拉取请求针对llama.cpp推理引擎,实现了使用f16掩膜的Flash Attention以减少VRAM使用。
此Pull Request为llama.cpp添加了MiniCPM5分词器支持,扩展了该工具对MiniCPM模型系列的兼容性。
一个针对 llama.cpp 的被拒绝的 PR 可在 AMD Strix Halo 硬件上为 MOE 模型提供高达 30% 的提示处理速度提升,但增益会随上下文长度增加而递减。