标签
本文讲解C++20的std::counting_semaphore和std::binary_semaphore,涵盖其API、用于限制并发和线程间信号传递的用法,以及重要细节。
深入探讨 utfcpp 库中 UTF-8 解码的优化,揭示 Clang 和 GCC 为 ASCII 快速路径生成不同的汇编代码,从而导致显著的性能差异。
Raymond Chen 继续他的系列文章,讨论在 C++/WinRT 中创建敏捷版 Windows Runtime 委托,并比较 C++/WinRT、C++/CX 和 WRL 如何处理不可封送委托和敏捷引用创建。
一篇博文指出,C++ 中浮点数到整数的转换在值不匹配时是未定义行为,并指出微软 GSL 库的安全窄化函数 'gsl::narrow' 也存在此未定义行为,与其文档说明相悖。
Kimi K3 纯文本模型现已获得 llama.cpp 支持,用户可通过这一 C++ 推理引擎在本地运行该开源大语言模型。
Fil-C 是一个完全内存安全的 C/C++ 实现,通过 LLVM IR 阶段的不可见能力(invisicaps)将指针值与边界信息捆绑,实现高兼容性,性能损失约 4 倍。
本文提出了一项系统研究,比较了RLHF流程中用于奖励模型评分的C++和PyTorch推理运行时,发现ONNXRuntime在CPU上提供加速,而torch.compile在GPU上领先,且批处理策略比语言或运行时选择更为重要。
经过长时间停更后,Gecode 6.3.0 和 6.4.0 现已发布,带来了现代化的构建系统(CMake)以及更新后的 MiniZinc 集成。
C++20 引入了基于范围的 for 循环的新语法,允许在循环作用域内声明初始化器,达到了与 Python 和 Lua 等语言一样的便利性。
该拉取请求为 llama.cpp 增加了初始的 ET 后端,扩展了大语言模型推理的硬件支持。
本文对比了旧的C++性能技巧与现代编译器的能力,表明编译器现在能够将朴素代码优化得比手工调整的技巧更好。包含在AMD Zen 5上使用Clang 21的基准测试。
BUSY 是一个精简、静态类型、跨平台的构建系统,支持 GCC、Clang 和 MSVC 工具链,旨在易于自举和最小依赖。
OpenAI工程师详细描述了Rockset的C++数据基础设施中看似不可能的崩溃的诊断过程,揭示了一个Azure上的静默硬件损坏bug以及GNU libunwind中存在18年的竞态条件,最终通过崩溃数据的流行病学分析得以解决。
这篇博客文章探讨了LLVM的SmallVector::push_back的一个优化:通过尾调用grow-and-push路径,消除了被调用者保存寄存器的溢出,从而提升了快速路径的性能。
一位用户分享了使用 MiMo V2.5 量化模型 (MiMo-V2.5-GGUF) 与 llama.cpp 生成并执行一个计算复利的 C++ 程序的成功经历,展示了模型辅助编码的有效性。
audio.cpp是一个C++/ggml运行时,集成了包括Qwen3-TTS、PocketTTS和VeVo2在内的12种音频模型,在CUDA上实现TTS速度比Python快5倍。