我使用ARM64汇编语言从头实现了YOLO26n模型推理(无框架)[P]
摘要
作者使用ARM64汇编语言从头实现了YOLO26n模型推理,没有使用任何外部框架,展示了底层AI推理技术。
暂无内容
相似文章
QLLM:无需Transformer和Mamba,具有O(1)推理的新型架构终于以模型形式发布
QLLM 引入了一种无需Transformer或Mamba的新型架构,实现了O(1)推理且无KV缓存。已发布一个1亿参数的模型作为概念验证,代码开源。
在Celeron N5095单板计算机上进行纯CPU推理:从0.6B到8B的6个模型基准测试
本文对在Celeron N5095单板计算机上运行纯CPU推理的六个AI模型(参数规模从0.6B到8B)进行了基准测试,并提供了性能对比。
为什么我们要编写自己的C和C++推理引擎
LocalAI 解释了为什么它要编写自己的 C/C++ 推理后端,并展示了其 vllm.cpp 移植版本在多个模型和硬件上的基准测试中,能够实现与 vLLM 相当或更高的吞吐量,同时占用空间远小于 vLLM。
LiquidAI/LFM2.5-2.6B
Liquid AI released LFM2.5-2.6B, a 2.6B-parameter hybrid model optimized for on-device deployment with 128K context, agentic post-training, and fast inference (220 tok/s on Apple M5 Max) under 2.5GB memory.
从零开始开发开源大语言模型:从预训练到RLHF(PPO/GRPO)
一位开发者分享了从零开始训练一个70亿参数开源大语言模型的进展,该模型基于DeepSeek架构并针对低显存进行了优化,目标是推动AI开发的民主化,并最终超越大型专有模型。