compilation

标签

Cards List
#compilation

各平台人机界面指南

Lobsters Hottest · 2小时前 缓存

本文整理并分享了来自Apple、Amiga等平台的多种人机界面指南,为UI设计师和开发者提供了宝贵的资源。

0 人收藏 0 人点赞
#compilation

我将Doom的渲染器编译成了一个21B参数的transformer——完全无需训练 [P]

Reddit r/MachineLearning · 2天前

该项目使用自定义编译器将Doom的渲染算法编译成一个21B参数的transformer,无需任何训练。生成的模型可以生成Doom的渲染帧,尽管在B200 GPU上速度较慢,仅为每天35帧。

0 人收藏 0 人点赞
#compilation

一种基于MLIR的大型语言模型编译方法

arXiv cs.CL · 2026-07-20 缓存

本文提出了一种基于MLIR的大型语言模型编译方法,通过两种自定义方言(TopOp和TpuOp)将模型从框架无关的语义逐层降低为硬件专用指令,并针对自回归推理阶段(预填充、预填充KV和解码)引入三阶段静态编译。

0 人收藏 0 人点赞
#compilation

最好的WebAssembly运行时可能仍然是根本没有运行时

Lobsters Hottest · 2026-07-08 缓存

本文使用支持宽算术的wasm2c对WebAssembly-to-C方法进行了基准测试,证明其在速度和内存使用方面仍然与专门的WebAssembly运行时(如Wasmer和Wasmtime)具有竞争力。

0 人收藏 0 人点赞
#compilation

Amber 编程语言,可编译为 Bash/Ksh/Zsh

Hacker News Top · 2026-07-07 缓存

Amber 是一种现代的、类型安全的编程语言,可编译为 Bash、Ksh 或 Zsh,从而实现更安全、更健壮的 Shell 脚本编写。

0 人收藏 0 人点赞
#compilation

运行CUDA内核时会发生什么?

Hacker News Top · 2026-06-29 缓存

从编译CUDA内核到在RTX 4090上执行的详细技术过程,涵盖NVCC编译管道、PTX、SASS以及底层系统调用。

0 人收藏 0 人点赞
#compilation

SKILL-DISCO:将智能体轨迹提炼并编译为可重用的程序化技能

arXiv cs.AI · 2026-06-26 缓存

Skill-DisCo 是一个框架,它将可重用的程序化技能从成功的智能体轨迹中提炼出来,并将其编译成可调用、可执行的程序。在 ALFWorld 和 WebArena 上的实验表明,该框架提高了成功率并减少了智能体的回合数。

0 人收藏 0 人点赞
#compilation

@Akashi203: 我开源了 AutoMegaKernel —— 将任意 HuggingFace 模型编译成一个持久的单一兆核,batch-1 解码带宽受限……

X AI KOLs Timeline · 2026-06-17 缓存

AutoMegaKernel 是一个开源代理框架,能将任意 HuggingFace 模型编译成一个持久的单一兆核(megakernel),将整个前向传播融合到一次 GPU 启动中,从而减少开销。在 L4 和 L40S 等推理级 GPU 上,它相比使用 CUDA Graph 的 cuBLAS 实现了最高 1.33 倍的加速,同时保证调度没有死锁和竞争条件。

0 人收藏 0 人点赞
#compilation

我不知道居然可以同时编译llamacpp来运行CUDA和Vulkan..

Reddit r/LocalLLaMA · 2026-06-16

作者发现同时使用CUDA和Vulkan后端编译llama.cpp是可行的,解码速度提升了约10% tokens/秒。他们计划运行进一步基准测试来评估其优势。

0 人收藏 0 人点赞
#compilation

构建系统重构

Lobsters Hottest · 2026-05-27 缓存

Zig 构建系统已经重构,将配置器和制造器进程分离,支持缓存、发布模式编译,并且'zig build'命令速度提升高达90%。这一变化提高了性能,并允许构建系统在不减速的情况下增加功能。

0 人收藏 0 人点赞
#compilation

@PyTorch: PyTorch 2.12 在编译、导出、分布式训练和加速器支持方面引入重大更新。亮点…

X AI KOLs Following · 2026-05-13

PyTorch 2.12 版本包括对编译、导出、分布式训练和加速器支持的重大更新,CUDA 上批量化 linalg.eigh 速度提升高达 100 倍,并新增了 torch.accelerator.Graph 等 API。

0 人收藏 0 人点赞
#compilation

在 Linux 和 Unix 系统上编译 Emacs 以提升性能的技术指南

Lobsters Hottest · 2026-05-12 缓存

本技术指南提供了在各类 Linux 发行版上从源码编译 Emacs 的详细步骤,旨在通过 CPU 特定指令集和 Wayland 等现代显示协议来优化性能。文中还涵盖了依赖项配置以及微调原生 Lisp 编译器以提升执行速度的相关内容。

0 人收藏 0 人点赞
#compilation

ReaComp:将LLM推理编译为符号求解器以实现高效程序合成

arXiv cs.CL · 2026-05-08 缓存

ReaComp将LLM推理轨迹编译为可重用的符号程序合成器,在程序合成基准测试中实现了强大的准确性,同时消除了测试时的LLM调用,显著降低了计算成本。

0 人收藏 0 人点赞
#compilation

像1997年那样编译Quake!

Fabien Sanglard · 2026-02-05 缓存

一份详细的指南,介绍如何重现使用Windows NT 4和Visual C++ 6等老式工具编译Quake的win32二进制文件的过程(就像1997年所做的那样)。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈