视觉变换器模型的Rust实现
摘要
一个用于构建和实验视觉变换器(ViT)模型的Rust crate,提供类型化配置、可重用结构体以及可运行的示例,适用于研究和生产环境。
在Rust中做深度学习,这个crate用于在Rust中构建和实验ViT风格的图像、视频、序列以及自监督变换器模型。它提供类型化配置、可重用的模型结构体、可运行的示例以及形状测试,适用于研究原型和Rust深度学习项目。如今,视觉变换器将图像视为序列。普通图像具有这样的形状:\[batch, channels, height, width\] 模型将图像转换为这样的形状:\[batch, tokens, dim\] 流程是:将图像分割成小块。将每个小块展平成一个长向量。将每个小块向量投影到dim维度。添加位置嵌入。运行变换器层。池化令牌。预测类别logits。了解更多信息请参见:https://github.com/iBz-04/vitch
相似文章
GitHub - kallewoof/tftf: 转换Transformer——超轻量级流水线,以最小开销操作巨型Transformer模型
tftf 是一个轻量级流式流水线,用于操作 HuggingFace safetensors 模型,支持 FP8 反量化、LoRA 合并等操作,无需将完整模型加载到内存中,从而最小化 RAM 和 VRAM 开销。
RyanCodrai/turbovec
turbovec 是一个基于 Rust 的向量索引,带有 Python 绑定,实现了谷歌的 TurboQuant 算法,提供高效的向量搜索,支持在线摄入,性能优于 FAISS,并具备过滤搜索能力。
GPU上的无畏并发:在Rust中进行安全的GPU推理,与vLLM/SGLang竞争 [R]
cuTile Rust 引入了一种基于块(tile)的编程模型,利用 Rust 的所有权机制来保证 GPU 内核的内存安全和无数据竞争,基于该模型构建的 Grout 推理引擎在 Qwen3 模型上实现了与 vLLM/SGLang 相当的吞吐量。
使用Rust和范畴论构建机器学习框架
这篇文章宣布了一份工作草稿书籍《Category Theory for Tiny ML in Rust》以及一个公开工作坊,介绍一个使用Rust和范畴论的微型机器学习流水线,旨在通过类型化转换使机器学习结构变得明确。
HOTPOT-可进化智能体规范框架
一个用Rust构建的新智能体规范框架,具有小巧的二进制体积、集成Vuepress用于文档展示、问题持久化以改进代码评审上下文、以及自修复能力。兼容多种智能体工具,目前仍在开发中。