一种面向智慧手术室的语音交互多智能体系统:架构设计与关键技术

arXiv cs.AI 论文

摘要

本文提出 SurgicalRoomAgent,一个面向智慧手术室的语音交互多智能体系统。该系统利用大语言模型实现自然语言设备控制,重点阐述其架构设计以及为降低无菌环境延迟而采用的 KV Cache 优化、渐进式提示披露等关键技术。

arXiv:2609.11231v1 公告类型:新 摘要:本文提出 SurgicalRoomAgent,一个基于大语言模型(LLMs)的、面向智慧手术室的语音交互多智能体系统。该系统通过包含语音交互流水线(唤醒、ASR、轮次检测、智能体推理、TTS)与智能体核心(技能注册表、任务规划器、设备管理器)的分层架构,实现了自然语言理解、设备控制、术中记录与手术报告生成。我们研究了三项关键技术:(1)KV Cache 前缀预热,用于低延迟推理,通过字节级最长公共前缀复用,将重计算开销从约 500 毫秒降低到数十毫秒;(2)流式部分 JSON 解析与早期并行任务执行,将端到端延迟降低约 30%;(3)渐进式技能提示披露,该技术根据用户角色、已连接设备和手术阶段动态过滤系统提示,以在有限的上下文窗口内最大化信息密度。系统使用 Qwen3-27B 模型与 llama.cpp/sglang 推理引擎实现。实验分析证明,系统能在 16,384 个 token 的上下文限制内有效运行,并且多设备并行控制的响应时间满足手术室实时性要求。
查看原文
查看缓存全文

缓存时间: 2026/09/12 08:24

# 面向智能手术室的语音交互多智能体系统:架构设计与关键技术
来源:https://arxiv.org/html/2609.11231  
周天翔††通讯作者:txzhou\-hust@outlook\.com所属机构:武汉联影手术设备有限公司(UIS)所属机构:中国武汉邮箱:[txzhou\-hust@outlook\.com](mailto:)

2026年9月

###### 摘要

手术室(OR)是医院内技术高度密集的临床环境之一,涉及手术灯、内窥镜系统、电外科单元、手术台等精密设备的协同运作。在传统手术室中,医护人员通过物理按钮、触摸屏或脚踏开关控制设备,这在无菌环境中存在交叉污染风险和操作中断问题。本文提出SurgicalRoomAgent,一种基于大语言模型(LLMs)的智能手术室语音交互多智能体系统。该系统通过分层架构实现自然语言理解、设备控制、术中记录和手术报告生成,架构包含语音交互流程(唤醒→ASR→轮次检测→智能体推理→TTS)和智能体核心(技能注册表、技能路由器、任务规划器、任务调度器、设备管理器)。重点研究三项关键技术:(1)基于KV缓存前缀预热的低延迟推理优化,通过字节级最长公共前缀(LCP)复用将设备状态变更导致的重计算开销从约500毫秒降至数十毫秒;(2)流式分片JSON解析与早期并行任务执行,在LLM流式输出期间检测完整任务数组并立即启动并行执行,使端到端延迟降低约30%;(3)渐进式技能提示披露,根据用户角色、连接设备和手术阶段动态过滤系统提示,在有限上下文窗口内最大化信息密度。系统基于Qwen3\-27B模型与llama\.cpp/sglang推理引擎实现,支持流式输出和实时设备控制。实验分析表明,系统能在16,384令牌上下文限制内有效运行,具备预期的提示预热命中率,多设备并行控制响应时间满足手术室实时性要求。

关键词:智能手术室;语音交互;大语言模型;多智能体系统;KV缓存优化;任务规划;渐进式披露

## 1 引言

### 1\.1 背景

现代手术室集成了大量精密医疗设备,包括手术灯、内窥镜摄像系统、高频电外科单元、超声刀、手术台和麻醉机。手术过程中,医护人员需要频繁操作这些设备,例如调节手术灯光亮度和色温、切换内窥镜视频源、控制电外科模式等。传统设备控制主要依赖物理按钮、触摸屏或脚踏开关,存在以下突出问题:

1. 无菌区干扰:处于无菌状态的外科医生无法直接接触设备控制面板,必须依赖巡回护士间接操作,导致指令传递延迟和沟通开销\[1 (https://arxiv.org/html/2609.11231#bib.bib1)\]。
2. 交叉污染风险:物理控制界面是手术室内的潜在污染源,频繁接触增加了医院获得性感染的风险\[2 (https://arxiv.org/html/2609.11231#bib.bib2)\]。
3. 认知负荷过重:手术室环境信息密集;医护人员需同时监测患者状态、设备参数和手术进程,认知负荷极高\[3 (https://arxiv.org/html/2609.11231#bib.bib3)\]。
4. 多设备协调困难:不同厂商的设备采用专有控制协议,缺乏统一交互层,难以实现跨设备协同控制。

近年来,大语言模型(LLMs)在自然语言理解、任务规划和代码生成方面展现出卓越能力\[4 (https://arxiv.org/html/2609.11231#bib.bib4)\],为解决这些问题提供了新的技术途径。特别是GPT\-4、Claude和Qwen等通用LLMs,可通过适当的系统提示设计和工具调用机制适配为领域专用智能助手\[5 (https://arxiv.org/html/2609.11231#bib.bib5)\]。

### 1\.2 研究现状

在智能手术室语音助手领域,已开展若干探索性研究。Hirides等人\[1 (https://arxiv.org/html/2609.11231#bib.bib1)\]开发了GePpeTto,一种基于GPT的AI手术助手,能够回答手术相关问题并提供术中决策支持。但该系统缺乏设备控制能力,且未考虑实时语音交互的延迟要求。Park等人\[6 (https://arxiv.org/html/2609.11231#bib.bib6)\]提出VISA(语音交互手术智能体),一种用于机器人手术的分层多智能体框架,通过语音指令控制达芬奇手术机器人。然而VISA聚焦于机器人手术场景,未涵盖通用手术室设备控制。Ng等人\[7 (https://arxiv.org/html/2609.11231#bib.bib7)\]设计了LLM驱动的机器人洗手护士系统,通过语音识别手术器械并控制机械臂传递器械,但该系统同样局限于机器人辅助手术场景。

在更广泛的LLM智能体领域,Wang等人\[8 (https://arxiv.org/html/2609.11231#bib.bib8)\]对医学领域LLM智能体进行了全面综述,提出分类体系和评估框架。Lee等人\[9 (https://arxiv.org/html/2609.11231#bib.bib9)\]提出DeviceAgent,一种自主移动设备UI控制框架,其设备控制方法与本研究相关。然而现有研究很少同时解决手术室环境中的实时语音交互、多设备协同控制和低延迟推理优化挑战。

### 1\.3 研究目标与贡献

为解决上述差距,本文提出SurgicalRoomAgent,一种面向智能手术室的语音交互多智能体系统。主要贡献如下:

1. 分层架构设计:提出分离语音交互流程与智能体核心的分层架构。六阶段语音流程(唤醒→ASR→轮次检测→智能体推理→LLM生成→TTS)实现端到端实时语音交互,智能体核心模块(技能注册表、任务规划器、设备管理器等)负责设备控制和术中记录。
2. KV缓存前缀预热优化:设计基于字节级最长公共前缀(LCP)复用的提示预热机制。通过异步预计算设备状态变更后的系统提示KV缓存,将实际推理请求的预填充开销从约500毫秒降至数十毫秒。
3. 流式分片JSON解析与早期任务执行:在LLM流式输出期间实时解析分片JSON。检测到完整任务数组时立即启动并行执行线程,实现“边生成边执行”流水线模式,显著降低端到端延迟。
4. 渐进式技能提示披露:基于用户角色、连接设备和手术阶段三个上下文层动态过滤系统提示,在有限上下文窗口内最大化有效信息密度,防止提示膨胀。
5. DAG任务规划与调度:采用卡恩算法进行分层拓扑排序,结合DFS三色环检测,支持多意图任务的依赖建模和并行执行。

论文结构如下:第2节 (https://arxiv.org/html/2609.11231#S2)回顾相关工作;第3节 (https://arxiv.org/html/2609.11231#S3)描述系统架构;第4节 (https://arxiv.org/html/2609.11231#S4)详述关键技术;第5节 (https://arxiv.org/html/2609.11231#S5)展示实现与性能分析;第6节 (https://arxiv.org/html/2609.11231#S6)进行讨论;第7节 (https://arxiv.org/html/2609.11231#S7)总结全文并展望未来方向。

## 2 相关工作

### 2\.1 手术室语音助手

手术室环境的语音交互研究可追溯至早期语音指令系统。近年来,LLMs的兴起推动了手术室语音助手的复兴。Hirides等人\[1 (https://arxiv.org/html/2609.11231#bib.bib1)\]开发了GePpeTto,一种基于GPT的AI手术助手,能够回答手术相关问题并提供术中决策支持。该系统验证了LLMs在手术知识领域的适用性,但缺乏设备控制能力,且未考虑实时语音交互的延迟要求。

Davila等人\[10 (https://arxiv.org/html/2609.11231#bib.bib10)\]探索了基于语音指令的手术机器人控制,提出自然语言处理指令解析框架。该系统结合规则匹配与意图分类,但在复杂多意图场景下泛化能力有限。Ng等人\[7 (https://arxiv.org/html/2609.11231#bib.bib7)\]设计了LLM驱动的机器人洗手护士,通过语音识别手术器械名称并控制机械臂传递器械,首次将LLMs引入手术室器械管理场景。然而该系统仅专注于器械传递,未涉及多设备协同控制。

Park等人\[6 (https://arxiv.org/html/2609.11231#bib.bib6)\]提出的VISA是与本研究最接近的工作之一。VISA采用分层多智能体架构,通过语音控制达芬奇手术机器人的各项功能。系统以GPT\-4作为核心推理引擎,支持具有上下文感知能力的多轮对话。但VISA的应用仅限于机器人手术场景,且未公开讨论推理延迟优化或设备状态管理的技术细节。

### 2\.2 基于LLM的医学智能体

Wang等人\[8 (https://arxiv.org/html/2609.11231#bib.bib8)\]对医学领域LLM智能体进行全面综述,提出包含感知、记忆、推理和行动的四模块分类体系。综述涵盖从临床决策支持到药物发现的应用场景,为医学智能体设计提供理论框架。Zhang等人\[11 (https://arxiv.org/html/2609.11231#bib.bib11)\]提出CardAIc\-Agents,一种用于心脏诊断的多智能体系统,验证了LLM智能体在临床推理任务中的有效性。

Zhi等人\[12 (https://arxiv.org/html/2609.11231#bib.bib12)\]研究临床对话重构,提出基于LLM的医患对话结构化方法,与本研究的术中记录自动生成功能相关。Choudhary和Purwar\[13 (https://arxiv.org/html/2609.11231#bib.bib13)\]提出i\-LAVA(内置LLM语音智能体),一种基于LLM的语音助手架构,探索LLM与语音交互的集成。

### 2\.3 实时语音交互系统

实时语音交互系统需解决端到端延迟、轮次检测和流式处理等关键技术挑战。Ethiraj等人\[14 (https://arxiv.org/html/2609.11231#bib.bib14)\]研究了低延迟语音智能体的设计,提出基于流式ASR和早期响应的延迟优化策略。其核心思想——在用户说完前开始推理——启发了本系统的流式处理设计。

对于轮次检测,传统方法主要依赖语音活动检测(VAD),通过设定固定静默阈值判断用户是否说完。但手术室环境存在大量设备噪声和多人对话场景,简单的VAD方法易产生误判。本工作采用基于LLM的二元轮次分类方法,将轮次检测建模为二元分类问题(0 = 闲聊/噪声,2 = 医疗指令),利用LLMs的语义理解能力提高准确性。

### 2\.4 LLM推理优化

LLM推理延迟主要来源于两个阶段:预填充(提示处理)和解码(令牌生成)。在手术室场景中,系统提示长约12,662令牌。设备状态变更导致前缀变化,触发全量预填充重计算,耗时约500毫秒。

KV缓存复用是降低预填充开销的关键技术。llama\.cpp\[15 (https://arxiv.org/html/2609.11231#bib.bib15)\]和sglang\[16 (https://arxiv.org/html/2609.11231#bib.bib17)\]等推理引擎支持基于LCP的KV缓存复用:当新请求与缓存请求共享相同前缀令牌序列时,可直接重用相应KV缓存,仅需计算增量部分。本工作采用PromptWarmer组件主动预热前缀KV缓存,使实际推理请求命中缓存以实现延迟优化。

### 2\.5 设备控制与任务规划

Lee等人\[9 (https://arxiv.org/html/2609.11231#bib.bib9)\]提出DeviceAgent框架,通过LLMs自主控制移动设备UI,验证了LLMs在设备控制场景的可行性。系统采用“截图\-推理\-行动”循环模式,但其延迟对于实时控制场景过高。

在任务规划领域,有向无环图(DAG)任务调度是分布式系统和工作流引擎中的经典方法\[17 (https://arxiv.org/html/2609.11231#bib.bib16)\]。本工作将DAG任务规划引入LLM智能体系统,采用卡恩算法进行分层拓扑排序以实现多意图任务的并行执行,同时使用DFS三色算法检测循环依赖以确保任务计划的有效性。

## 3 系统架构

### 3\.1 整体架构

SurgicalRoomAgent系统采用分层架构,如图1 (https://arxiv.org/html/2609.11231#S3.F1)所示。系统分为两大层:语音交互流程和智能体核心。语音交互流程将用户语音输入转换为文本指令,并将智能体文本响应转换为语音输出。智能体核心负责意图理解、任务规划、设备控制和响应生成。

见图注图1:SurgicalRoomAgent系统运行概览,展示语音交互流程与智能体核心模块。

### 3\.2 语音交互流程

语音交互流程包含五个通过HTTP/WebSocket通信的微服务:

1. 唤醒服务(端口10099):基于Sherpa\-ONNX的关键词定位(KWS)模块,检测预设唤醒词并触发后续语音识别流程。唤醒事件通过单播发送至当前音频所有者,避免广播导致的TTS串扰。
2. 实时ASR服务(端口10095):支持

相似文章

从提示到协议:实验室自动化的AI代理

arXiv cs.AI

本文介绍了一种AI代理,它将大型语言模型与实验室编排软件集成,使科学家能够使用自然语言创建、监控和管理自动化的实验室协议。在三个模拟实验室上的评估显示,该代理实现了97%的首次尝试协议生成成功率,并且所需的界面操作大幅减少。