pull-request

标签

Cards List
#pull-request

vulkan: 使TP可行 · Pull Request #25051 · ggml-org/llama.cpp

Reddit r/LocalLLaMA · 2026-06-26 缓存

此拉取请求使得在使用Vulkan后端时,llama.cpp中的张量并行(TP)变得可行,从而能够在多个GPU上进行分布式推理。

0 人收藏 0 人点赞
#pull-request

Bun 开放拉取请求,为 JavaScriptCore 添加共享内存线程支持

Hacker News Top · 2026-06-20 缓存

Bun 有一个开放的拉取请求,为 JavaScriptCore(WebKit 底层的 JavaScript 引擎)添加共享内存线程支持。这一增强可能提高 Bun 中多线程 JavaScript 工作负载的性能。

0 人收藏 0 人点赞
#pull-request

@dabit3:今天 Devin 迎来了一次重大升级,我们持续扩展 Devin 的安全能力。每次拉取请求都会得到…

X AI KOLs Following · 2026-06-18 缓存

今天 Devin 获得了一次重大的安全升级,使其能够以安全工程师的深度审查每一次拉取请求。

0 人收藏 0 人点赞
#pull-request

@jamonholmgren:几天前,一位来自苹果的开发者向 Godot 提交了一个拉取请求,并在末尾添加了 AI 使用说明,说明了他们如何使用 AI……

X AI KOLs Timeline · 2026-06-16 缓存

一位来自苹果的开发者向 Godot 提交了一个带有 AI 使用说明的拉取请求,推文作者对此表示赞赏,并建议在开源贡献中采用这种做法。

0 人收藏 0 人点赞
#pull-request

ServeurpersoCom 的 UI/svg 块渲染 · 拉取请求 #24080 · ggml-org/llama.cpp

Reddit r/LocalLLaMA · 2026-06-15 缓存

针对 llama.cpp 的拉取请求 #24080 增加了 UI/svg 块渲染,增强了项目的界面能力。

0 人收藏 0 人点赞
#pull-request

@MiaAI_lab: 一个针对 vLLM 的 PR,允许 MiniMax M3 使用 TP=3。它的 NVFP4 量化版本大小为 260GB - lukealonso/MiniMax-M3-NVFP4 希望这能...

X AI KOLs Timeline · 2026-06-14 缓存

一个对 vLLM 的拉取请求为 MiniMax M3 增加了张量并行度 3 的支持(使用其 NVFP4 量化),使得该模型可以在 3 台 DGX Sparks(每台 87GB 显存)上运行。

0 人收藏 0 人点赞
#pull-request

@TechWithTimm:大多数AI编程工具仍然需要你持续介入。但Devin可以接手任务,在云端持续工作,然后…

X AI KOLs Following · 2026-06-14 缓存

这条推文推广了Devin,一款在云端自主工作的AI编程工具,无需用户监督即可生成pull request,并附有教程视频链接。

0 人收藏 0 人点赞
#pull-request

为 cohere2-MoE 添加架构支持,由 michaelw9999 · 拉取请求 #24260 · ggml-org/llama.cpp

Reddit r/LocalLLaMA · 2026-06-13 缓存

此拉取请求为 llama.cpp 添加了 cohere2-MoE 模型的架构支持,实现了对该混合专家模型(Mixture of Experts)的推理。

0 人收藏 0 人点赞
#pull-request

移除MTP中的填充和多重D2D拷贝 - 由gaugarg-nv提交 · 拉取请求#24086 · ggml-org/llama.cpp

Reddit r/LocalLLaMA · 2026-06-10 缓存

一个针对 llama.cpp 的拉取请求,移除了多令牌预测 (MTP) 中的填充和多重设备到设备拷贝,提高了 GPU 上的性能。

0 人收藏 0 人点赞
#pull-request

mtmd:由 ngxson 添加视频输入支持 · 拉取请求 #24269 · ggml-org/llama.cpp

Reddit r/LocalLLaMA · 2026-06-08 缓存

本拉取请求为 llama.cpp 添加了视频输入支持,使多模态模型能够通过新的 mtmd 组件处理视频数据。

0 人收藏 0 人点赞
#pull-request

kv-cache : 避免kv cells复制 by ggerganov · Pull Request #24277 · ggml-org/llama.cpp

Reddit r/LocalLLaMA · 2026-06-08 缓存

ggerganov的此pull request优化了llama.cpp中的kv-cache,以避免不必要的kv cells复制,从而提升推理性能。这是对开源LLM推理库llama.cpp的一个贡献。

0 人收藏 0 人点赞
#pull-request

SYCL: 从 CUDA 后端移植多列 MMVQ(在 Intel Arc 上获得约 45% 的推测解码加速)by masonmilby · Pull Request #21845 · ggml-org/llama.cpp

Reddit r/LocalLLaMA · 2026-06-05 缓存

一个针对 llama.cpp 的拉取请求,将多列 MMVQ 从 CUDA 移植到 SYCL,在 Intel Arc GPU 上实现了约 45% 的推测解码加速。

0 人收藏 0 人点赞
#pull-request

模型:Granite4 Vision,作者 gabe-l-hart · 拉取请求 #23545 · ggml-org/llama.cpp

Reddit r/LocalLLaMA · 2026-06-05 缓存

此拉取请求为 llama.cpp(一个开源 LLM 推理引擎)增加了对 Granite4 Vision 模型的支持。

0 人收藏 0 人点赞
#pull-request

ui: 聊天中的Mermaid图表与交互预览 (由allozaur提交 · PR #24032 · ggml-org/llama.cpp)

Reddit r/LocalLLaMA · 2026-06-03 缓存

新增在聊天中渲染Mermaid图表的功能,并在llama.cpp网页界面中提供交互预览。

0 人收藏 0 人点赞
#pull-request

StepFun 3.5 MTP 由 pwilkin 提交 · 拉取请求 #23274 · ggml-org/llama.cpp

Reddit r/LocalLLaMA · 2026-06-02 缓存

为 llama.cpp 添加 StepFun 3.5 MTP 模型支持的拉取请求。

0 人收藏 0 人点赞
#pull-request

llama: 限制 `llama_context` 的最大输出数 by am17an · Pull Request #23861 · ggml-org/llama.cpp

Reddit r/LocalLLaMA · 2026-06-01 缓存

llama.cpp 是一个开源的 LLM 推理引擎,使用 C/C++ 编写,依赖极少,支持多种硬件和量化方法。此拉取请求限制了 llama_context 的最大输出数。

0 人收藏 0 人点赞
#pull-request

@FinanceYF5: 太酷了! Peter Steinberger 把 Codex 调教成了全自动 QA 机器人。 现在每次代码提交后,它会自己生成测试用例、模拟用户操作跑测试,发现 bug 还能直接写修复代码提 PR。 开发效率直接拉满了!

X AI KOLs Following · 2026-06-01 缓存

Peter Steinberger利用Codex构建了全自动QA机器人,每次代码提交后自动生成测试、运行测试,并能在发现bug时自动修复并提交PR,大幅提升开发效率。

0 人收藏 0 人点赞
#pull-request

llama: 使用f16掩膜进行FA以节省VRAM(作者 am17an)· 拉取请求 #23764 · ggml-org/llama.cpp

Reddit r/LocalLLaMA · 2026-05-29 缓存

此拉取请求针对llama.cpp推理引擎,实现了使用f16掩膜的Flash Attention以减少VRAM使用。

0 人收藏 0 人点赞
#pull-request

由zhangtao2-1添加MiniCPM5分词器支持 · Pull Request #23384 · ggml-org/llama.cpp

Reddit r/LocalLLaMA · 2026-05-27 缓存

此Pull Request为llama.cpp添加了MiniCPM5分词器支持,扩展了该工具对MiniCPM模型系列的兼容性。

0 人收藏 0 人点赞
#pull-request

Strix Halo 用户:一个被拒绝的 PR 可使 MOE 的 PP 速度提升高达 30%。

Reddit r/LocalLLaMA · 2026-05-26

一个针对 llama.cpp 的被拒绝的 PR 可在 AMD Strix Halo 硬件上为 MOE 模型提供高达 30% 的提示处理速度提升,但增益会随上下文长度增加而递减。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈