kv-cache-optimization

标签

Cards List
#kv-cache-optimization

一种面向智慧手术室的语音交互多智能体系统:架构设计与关键技术

arXiv cs.AI · 2026-09-12 缓存

本文提出 SurgicalRoomAgent,一个面向智慧手术室的语音交互多智能体系统。该系统利用大语言模型实现自然语言设备控制,重点阐述其架构设计以及为降低无菌环境延迟而采用的 KV Cache 优化、渐进式提示披露等关键技术。

0 人收藏 0 人点赞
#kv-cache-optimization

在推理阶段为预训练大语言模型应用滑动窗口注意力 [P]

Reddit r/MachineLearning · 2026-09-06

本项目为 Hugging Face 预训练大语言模型实现了一个可复用的滑动窗口注意力推理层,利用带 attention sinks 的受限 KV 缓存,显著降低显存占用并加快解码速度。在 Qwen2.5-7B 上的测试表明,16K 上下文下显存从约 923 MB 降至约 3.5 MB,不过依赖远距离上下文的任务可能会出现性能下降。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈