标签
Ultralight Digital Human 是一个开源 Python 项目,支持从 3-5 分钟的视频中训练一个面向特定人物的音频驱动数字人,并支持 HuBERT/WeNet 音频特征、ONNX 导出和流式推理。
他们发布了一个统一的多头安全分类器(mmBERT-small编码器,七个头),使用掩码损失处理缺失任务标签,在七个任务上取得了高F1分数,同时还发布了量化的ONNX INT8变体。权重和指标已公开。
介绍了qZACH-ViT,这是ZACH-ViT的量化感知扩展,具有递归内在解释,以及用于稳定归因梯度的递归归因稳定优化(RASO)。在INT8转换后的MedMNIST数据集上实现了高预测一致性和加速。
探讨了在没有GPU的情况下,在CPU上使用Qwen3-ASR和Kokoro-TTS ONNX模型运行语音助手的性能,测量响应时间。
Manticore Search 27.1.5 引入了一个新的 ONNX Runtime 后端用于嵌入,其性能比之前的 SentenceTransformers/Candle 路径提升约14倍,吞吐量从每秒5-11个文档提高到每秒70-230个文档,并且无需更改API。
Simon Willison借助Claude Code,将Moebius 0.2B图像修复模型移植到浏览器中运行,使用了WebGPU和ONNX Runtime。最终的演示允许用户上传图片并通过修复移除物体。
archex是一个本地优先、确定性的工具,用于为AI代理构建具有令牌预算的代码上下文包。它使用完整的检索管道(BM25F、本地嵌入、交叉编码器重排序器、依赖图扩展),在您的硬件上运行,无需API密钥或遥测,在召回率和效率方面优于替代方案。
OpenCV 5 是计算机视觉库的重大版本更新,包含全新的 DNN 引擎、改进的 ONNX 支持、硬件加速以及更简洁的架构。对于从事经典视觉、深度学习及边缘部署的开发者而言,这标志着一次重要的现代化升级。
NVIDIA 在 Hugging Face 上发布了 Kokoro TTS 模型的优化 ONNX 版本。这款拥有 8200 万参数的模型轻量、快速,且可用于商业用途。
一个深入探讨的视频,解释如何使用 Transformers.js 从 JavaScript 运行 AI 模型,涵盖张量、ONNX、量化、WebGPU/WASM 等。
使用 ml-intern 和 DeepSeek V4 Flash 训练了一个提示注入分类器,使用 DistilBERT 实现 F1 99%,优化至 ONNX int8(约 65 MB),可通过 Transformers.js v3 在浏览器中运行。
Supertonic 是一款新的开源TTS引擎,通过ONNX在设备上运行,支持31种语言,在速度上超越ElevenLabs,即使在无GPU的树莓派上也能运行。