在自由线程Python中扩展NumPy
摘要
本文讨论了为改进NumPy在自由线程Python(无全局解释器锁的Python)上的性能所做的努力,从而实现了更好的并行性和可扩展性。
<p><a href="https://lobste.rs/s/3s9cva/scaling_numpy_on_free_threaded_python">评论</a></p>
相似文章
自由线程Python:过去、现在与未来
Thomas Wouters 在 PyCon US 2026 上发表了关于自由线程 Python 的过去、现在与未来的演讲,该 Python 版本移除了全局解释器锁 (GIL),允许并行线程执行。
@DailyDoseOfDS_: 终于,Python 3.14 允许你禁用 GIL!这是个重大消息,因为之前即使你写了多线程代码,Pyth…
Python 3.14 引入了禁用全局解释器锁(GIL)的功能,实现了多线程代码的真正并行执行,克服了长期存在的限制。
Show HN: Runloom – 适用于Python自由线程的Go风格协程
Runloom是一个新的Python库,为自由线程Python(3.13t/3.14t)提供了Go风格的栈式协程和任务窃取调度器,使得阻塞代码能够在无GIL的情况下跨核心并发运行。它声称在生成吞吐量和调度性能上可以与Go匹敌或超越。
PSA:测试你在 llama.cpp 中的“线程”参数(我的情况提升了 80% 的性能)
一位用户使用 Gemma 4 在 llama.cpp 中针对混合 CPU-GPU 推理进行了线程数基准测试,发现在混合核心 CPU 上使用 16 个线程而非 6 个可提升 80% 的性能,并分享了最佳命令配置。
尽管有高度优化的NumPy函数,torch.compile()如何实现大幅加速?[D]
作者解释了算子融合是torch.compile加速的关键机制,并提供了一个仅500行的Python最小实现及配套的笔记作为教学工具。