标签
本文介绍MusCoRe,一种颜色频率压缩协议,可将AI代理对话的令牌使用量减少71.9%,实现在无GPU依赖的低资源设备上进行潜在本地推理。
本文提出了MAS-DecStream,一种用于移动边缘-云基础设施中流处理的去中心化调度框架,通过LLM辅助协商扩展了合同网协议。实验表明,与基于规则的基线相比,延迟违规减少且效用提高。
Cloudflare 回顾了其 Agents Week,重点介绍了用于构建、运行和保护 AI 代理的新工具和产品,包括 Cloudflare Agents、可编程钱包、CI/CD 改进以及 Agent 开发生命周期。
本文提出ZeroLock,一种无反向传播的并发内存高效LLM训练算法,将模型更新解耦为独立的分块更新,与基于BP的基线相比,内存使用减少26.5%,吞吐量提高4.9%。
Google的开发者专家社区构建了一个离线AI赛车教练,它在边缘处理实时车辆遥测数据,展示了不依赖云端的实时AI能力。
Oxc 包现在可以使用 wasm32-wasip1 目标在 Cloudflare Workers 上运行,并提供实时演示和部署说明。
文章认为,大规模AI数据中心的建设是由补贴定价而非实际需求驱动的投机泡沫,AI的未来在于边缘侧更小的开源模型。文章强调了这对能源电网和气候目标的负面影响,并警告泡沫破裂可能导致经济衰退,但不会终结AI。
一位开发者成功在ESP32 Dev Kit V1上运行了量化至INT4的520万参数MoE LLM,仅使用81KB SRAM,通过从闪存流式加载专家,实现了约每秒5个token的速度。
本文实证研究了剪枝、对抗训练和硬件引起的权重故障如何共同影响卷积神经网络的可靠性,发现对抗训练会增加对固定为零故障的敏感性,而剪枝对故障敏感性几乎没有影响。
本文提出了一种用于边缘计算中流量预测的时空图Transformer框架,结合图神经网络捕捉空间相关性,以及Transformer自注意力捕捉长程时间依赖。在真实蜂窝数据上的实验表明,它优于基于循环图的基线模型,如GCN-LSTM和GCN-GRU。
作者认为传统企业AI技术栈已经过时,声称一台599美元的Mac mini运行Ollama就能以80%的质量本地处理80%的AI工作负载,而成本仅为租用云GPU的一小部分。
一个名为 kimi-k3-in-c 的新工具,在单个 CPU 上以低至 8.24 GB 的内存运行 2.78T 参数的 Kimi K3 开源模型,从磁盘流式加载专家,并以每 token 10-32 秒的确定性输出运行。
EdgeRazor 是一个轻量级框架,用于通过熵引导的混合精度量化感知蒸馏来压缩大语言模型,实现每参数 1.88 比特,同时保持教师模型的能力,且无需更改 llama.cpp 等推理实现。该方法在 MobileLLM 和 Qwen 变体等小型模型上进行了演示。
Kedge 是一个全球分布式云平台,提供硬件隔离的虚拟机、全局SQLite数据库、无服务器函数以及按秒计费的自动扩缩容。它旨在简化靠近用户的全栈应用部署。
ProcAgent 是一个完全在设备端运行的、基于视觉的智能体程序助手,采用提出-验证架构,在 NVIDIA Jetson AGX Orin 上实现实时自适应指导。它支持反应式和主动式两种模式,并支持人在回路中的确认,实现响应式交互,并在用户研究中获得积极评价。
Hackster.io分享了一种在Raspberry Pi上无需Linux即可运行本地LLM的方法,实现裸机执行。
本文通过实验研究提示词表述如何影响端侧大语言模型的能耗,表明关键词选择会显著影响解码长度和总能耗,并提示工程可作为轻量级能耗优化手段。
本文提出OrchNAS,一种能量感知的个性化联邦边缘智能框架,该框架利用神经架构搜索服务自动为异构边缘环境设计服务自适应模型,解决能量约束和统计异质性问题。
Verizon宣布与谷歌达成10亿美元暗光纤交易,并计划将中心局改造为小型数据中心用于AI推理,这是其新推出的AI Connect计划的一部分。
Cloudflare 宣布收购 AI 模型平台 Replicate,计划将其 5 万多个开源/商业模型及开发者工具集成到全球网络和 Workers AI 平台中。