标签
一场静默的革命正在让强大的AI模型无需昂贵GPU即可在消费级硬件上运行,这得益于量化技术和优化实现(如llama.cpp的Gemma4 MTP支持)的突破,为爱好者、小型企业和边缘计算打开了大门。
作者宣布了一篇新的博客文章,内容是关于将三台Jetson Nano Orin Super组成集群,用于分布式训练和推理,延续了一个系列,旨在帮助人们使用易于获取的硬件构建小型计算集群。
一位开发者认为,边缘AI社区忽视了那些可以在智能手机等设备上本地运行的小型专门模型,并以自建的离线摩尔斯电码识别功能为例。该项目使用了小于5MB的AI模型,基于TensorFlow/Keras和LiteRT,从数据生成到移动端集成的整个流程均为自建。
Google发布了Gemma 4 12B,这是一个采用Apache 2.0许可证的开源多模态AI模型,可在拥有16GB内存的笔记本电脑上本地运行,面向企业边缘部署。
作者在本地新机器上使用Qwen3.6-35B-A3B模型和oMLX工具进行日常任务,发现速度和效果远超预期,甚至在PA和Coding场景下优于远程LLM,体现了端侧AI能力的显著提升。
一项对8个小型LLM(参数规模从1.35亿到约10亿)在售价250美元的Jetson Orin Nano Super上进行的深入基准测试,涵盖四种功率模式,发现25W是帕累托最优模式,其中SmolLM2-135M达到165.1 tok/s,效率最高。
NVIDIA宣布在Jetson上支持JetPack 7.2和NemoClaw,将代理式AI能力带给机器人和工业自动化等边缘设备,并带来性能提升和新的开发者工具。
NVIDIA 发布工厂运营蓝图 (FOX),这是一项参考设计,用于构建能够集成实时数据、自动化模型训练并编排专用代理的自主工厂管理 AI 代理,已获多家主要制造商早期采用。
Liquid AI 发布了 LFM2.5-8B-A1B,这是一个8B MoE模型,拥有1.5B活跃参数和128K上下文,为边缘设备优化。
一个7MB的开源L4级自动驾驶AI被训练从视觉和传感器输入中学习导航、车道保持和漂移恢复,设计用于在手机和嵌入式设备上运行,无需重型基础设施。
NVIDIA发布了售价249美元的Jetson Orin Nano Super开发者套件,一款能本地运行Llama 3、Mistral等大模型的AI电脑,可将每月200美元的OpenAI账单降至仅22美元电费。
演示在低成本RISC-V微控制器(CH32H417)上运行具有1260万int8量化参数的DCGAN,使用纯C推理和量子熵采样,在26秒内生成64x64的猫脸图像。
BitCPM 是一个来自 ModelBest、清华大学和 OpenBMB 的新开源模型,它使用三元权重(-1,0,1)在手机上运行全尺寸AI模型。
为Orange Pi AIPro(Ascend 310B NPU)上的MiniCPM-V 4.6开发了自定义C++推理引擎,通过为matmul和causal-conv1d编写优化的AscendC内核,实现了相比原始框架2倍的加速,达到5.90 tokens/s。
BitCPM-CANN 是首个在完全基于中国自主研发AI基础设施(华为昇腾910B)上训练的开源1.58位三值大语言模型,实现了极致的存储缩减,适用于边缘部署。
General Instinct 推出一个部署层,使前沿AI模型能够在如 Jetson 和移动 NPU 等受限边缘硬件上运行,帮助机器人技术和物理AI团队实现低延迟离线推理。
一条推文认为,下一波人工智能浪潮将是边缘设备上的紧凑智能,而非更大的数据中心,Liquid AI 支持在手机、汽车和日常设备上运行 AI 的愿景。
深入剖析在偏远或无网络连接环境中部署边缘设备时更新AI模型所面临的真实挑战,涵盖连接窗口、技术人员上门、网格传播以及接受模型过时等策略。
本文提出了一种面向循环智能制造的边缘AI驱动分散式任务分配框架,该框架利用学习排序方法来匹配赢家选择的排序性质。仿真结果表明,在高负载和紧截止期限场景下,延迟、截止时间满足率和能源效率均得到改善。
本文提出了一种用于生态监测的知识自适应边缘专家代理架构,将视觉感知与推理分离,以减少对云资源的依赖,并在远程部署中实现可持续的端侧AI。