edge-deployment

标签

Cards List
#edge-deployment

RobustMAD:评估多模态小语言模型在可部署异常检测助手中的实际鲁棒性

arXiv cs.LG · 4天前 缓存

RobustMAD 引入了一个基准,用于评估多模态小语言模型在实际部署的工业异常检测助手中的鲁棒性。它揭示了关键的失败模式,并为下一代系统提供了指导。

0 人收藏 0 人点赞
#edge-deployment

重新思考小型VLM量化:从组件分析到硬件感知的边缘部署

arXiv cs.LG · 2026-07-10 缓存

本文系统性地评估了Jetson边缘设备上小型视觉语言模型的组件级量化,发现模型架构(MoE vs 稠密)显著影响量化敏感性,且量化误差在大体上是累加的,除了模态对齐路径之外。

0 人收藏 0 人点赞
#edge-deployment

轻量级入侵检测模型在工业物联网网络中的跨域泛化失败

Hugging Face Daily Papers · 2026-07-01 缓存

本文研究了用于工业物联网入侵检测的轻量级机器学习模型的跨域泛化失败,发现它们依赖于粗糙的端口特征,并且对抗鲁棒性与跨网络性能无关。

0 人收藏 0 人点赞
#edge-deployment

小大脑,大成就:探索紧凑型语言模型

Hugging Face Daily Papers · 2026-06-29 缓存

本文对17个紧凑型语言模型(1B-8B参数)在俄语RAG系统中作为生成器进行了基准测试,仅使用CPU推理,发现Qwen系列模型在私有、无GPU部署中提供了出色的质量-延迟权衡。

0 人收藏 0 人点赞
#edge-deployment

压缩递归推理模型用于边缘设备时,什么得以保留?

arXiv cs.LG · 2026-06-26 缓存

对压缩递归推理模型用于边缘硬件进行系统研究发现,激进量化会破坏全局推理,同时保留局部预测。该论文引入每通道校准的INT4以恢复推理能力,并提供了适配8 MB SoC和4 MB MCU目标的部署方案。

0 人收藏 0 人点赞
#edge-deployment

@_avichawla: AI工程师应知的4种AI代理部署策略。(收藏此帖)代理可以按计划运行、在流上运行、…

X AI KOLs Timeline · 2026-06-25 缓存

一条推文线程解释了四种AI代理部署策略:批量部署、流部署、实时部署和边缘部署,并附有详细描述和使用场景。

0 人收藏 0 人点赞
#edge-deployment

用于设备端故障检测的轻量级Transformer模型:资源受限部署的基准研究

arXiv cs.LG · 2026-06-24 缓存

一项基准研究,在三个公开数据集上对比了传统机器学习方法(随机森林、XGBoost、SVM、逻辑回归)与轻量级Transformer变体(DistilBERT、TinyBERT、MobileBERT)在设备端故障检测中的表现。传统机器学习在远小得多的资源占用下实现了有竞争力的准确率,而TinyBERT-4L是最便于部署的Transformer模型。

0 人收藏 0 人点赞
#edge-deployment

@AdinaYakup: 百度 @PaddlePaddle 发布 PP-OCRv6:tiny 1.5M / small 7.7M / medium 34.5M,支持 48+ 种语言,支持手写/……

X AI KOLs Following · 2026-06-11 缓存

百度 PaddlePaddle 发布了 PP-OCRv6,一款支持 48+ 种语言的 OCR 模型,提供 tiny(1.5M)、small(7.7M)和 medium(34.5M)三种尺寸,针对边缘部署进行了优化,可处理手写、印刷、工业、屏幕和卡片文字。

0 人收藏 0 人点赞
#edge-deployment

Recover-LoRA用于激进量化:通过合成数据上的知识蒸馏低秩适配恢复2比特语言模型精度

arXiv cs.LG · 2026-06-04 缓存

AMD的研究人员提出了Recover-LoRA,该方法利用基于合成数据的知识蒸馏低秩适配,恢复因LLM激进2比特量化而损失的精度。在Qwen3-4B模型上仅使用1万个合成样本,就在12个基准测试中的9个上实现了80%–95%的精度恢复。

0 人收藏 0 人点赞
#edge-deployment

通过联合优化架构与量化策略实现 LLM 压缩

arXiv cs.LG · 2026-06-04 缓存

来自 UiT 和奥斯陆大学的研究人员提出了一种可微分 NAS 框架,能够联合优化 LLM 压缩中的架构配置与混合精度量化策略。与先 NAS 后量化的顺序基线方法相比,该框架在七项推理任务中可实现最高 1.4 倍的推理加速,或最高 6% 的精度提升。

0 人收藏 0 人点赞
#edge-deployment

RightNow-Arabic-0.5B-Turbo:一款通过词汇注入和边缘优先部署的开源亚10亿参数阿拉伯语语言模型

arXiv cs.CL · 2026-05-29 缓存

RightNow-Arabic-0.5B-Turbo 是一款基于 Qwen2.5-0.5B 构建的开源 518M 参数阿拉伯语专用语言模型,通过词汇注入和持续预训练,在阿拉伯语基准测试中取得了有竞争力的性能,同时可通过量化部署在边缘设备上。

0 人收藏 0 人点赞
#edge-deployment

@ModelScope2022: MiniCPM5-1B 现已完全开源,包含权重、训练数据和部署代码。1B参数,在Artificial Analysis上排名第一…

X AI KOLs Following · 2026-05-25 缓存

MiniCPM5-1B 已完全开源,包含权重、训练数据和部署代码;它在2B以下模型中取得最高评分,并可在边缘设备上运行。

0 人收藏 0 人点赞
#edge-deployment

@rohanpaul_ai: 就在几天前,Thinking Machines Lab (TML) 展示了一种让 AI 交互从轮次式变为连续式的新方法…

X AI KOLs Following · 2026-05-17 缓存

Thinking Machines Lab 和 OpenBMB 发布了 MiniCPM-o 4.5,这是一个 9B 参数的全双工全模态模型,采用 Omni-Flow 框架,支持连续、时间对齐的实时视频和语音交互,超越了之前的模型,并以开源形式提供。

0 人收藏 0 人点赞
#edge-deployment

@FeitengLi: OpenBMB 开源 MiniCPM-V 4.6 了,1.3B 参数(SigLIP2-400M + Qwen3.5-0.8B),262k 上下文,视觉编码 FLOPs 比上一代少 50%+。 同任务 token 成本比 Qwen3.5-0…

X AI KOLs Timeline · 2026-05-16 缓存

OpenBMB releases MiniCPM-V 4.6, a 1.3B-parameter multimodal LLM with 262k context and significantly reduced visual encoding FLOPs, achieving strong benchmark performance and broad inference framework support.

0 人收藏 0 人点赞
#edge-deployment

Ternary Bonsai:1.58 比特下的顶级智能

Hacker News Top · 2026-04-18

一种使用三值权重(-1、0、1)的高效 AI 模型架构,仅需 1.58 比特/参数即可实现具有竞争力的性能,可部署在极度受限的设备上。

0 人收藏 0 人点赞
#edge-deployment

将机器人AI引入嵌入式平台:数据集录制、VLA微调和设备端优化

Hugging Face Blog · 2026-03-05 缓存

NXP和Hugging Face展示了在嵌入式机器人平台上部署视觉-语言-动作(VLA)模型的技术,涵盖数据集录制最佳实践、VLA微调以及针对i.MX 95处理器的设备端优化,包括量化和异步推理调度。

0 人收藏 0 人点赞
#edge-deployment

Tequila:一种面向大语言模型的无陷阱三元量化方法

Papers with Code Trending · 2025-09-28 缓存

本文介绍了Tequila,这是一种针对大语言模型的无陷阱量化方法,通过将陷入死区的权重重新利用为动态偏置,提高了三元量化的准确性和推理速度。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈