MODF-SIR:面向社会智能推理的多智能体全能模态蒸馏框架
摘要
本文提出MODF-SIR,一个基于轻量级多模态大语言模型的多智能体协作框架,用于社会智能推理。它采用知识蒸馏、长尾事件提取和测试时自适应,以更少的训练数据实现了最先进的结果。
arXiv:2606.12018v1 公告类型: 新
摘要: 我们提出了一个基于轻量级多模态大语言模型(MLLM)的多智能体协作框架,专门用于社会智能推理。我们方法的一个关键特征是训练和推理阶段均通过知识蒸馏进行增强。在该架构内,与社会智能相关的多模态数据被精确定位。此外,相关的长尾事件被识别、提取并以格式化的显式文本呈现。这种格式化策略防止了关键的长尾信息在分词过程中被头部事件和环境噪声淹没。具体来说,我们将测试时自适应(TTA)整合到整个推理流程中,包括长尾事件的提取和表示、思维链(CoT)提示和自反思。该TTA机制也通过低秩适配(LoRA)进行蒸馏增强,仅针对实例级推理微调基础模型。在多个基准上对各种开源和专有AI模型进行的广泛评估证明了所提框架的有效性。仅使用IntentTrain约30%的训练数据,我们就实现了最先进的结果。代码见 https://github.com/eeee-sys/MODF-SIR,演示见 https://huggingface.co/spaces/Harry-1234/MODF-SIR,LoRA权重见 https://huggingface.co/Harry-1234/MODF-SIR,训练路由器的数据集见 https://huggingface.co/datasets/Harry-1234/IntentRouterTrain。
查看缓存全文
缓存时间: 2026/06/11 13:50
# MODF-SIR:面向社会智能推理的多智能体全模态蒸馏框架 来源:https://arxiv.org/html/2606.12018 尚马,党基盛,张文灿,张逸帆,王碧梅,彭鸿,胡斌,田奇,蔡达成本工作受国家自然科学基金(项目号:62227807 和 U24B20186)资助。同时得到兰州大学超级计算中心的支持。尚马、党基盛、张逸帆、王碧梅和彭鸿任职于兰州大学信息科学与工程学院,中国兰州(电子邮件:[email protected])。胡斌任职于北京理工大学医学技术学院,北京 100081,中国(电子邮件:[email protected])。田奇任职于华为云与 AI BU,深圳 518129,广东,中国(电子邮件:[email protected])。张文灿和蔡达成任职于新加坡国立大学计算机学院,新加坡 119077(电子邮件:[email protected])。*通讯作者:党基盛、王碧梅、胡斌。 ###### 摘要 我们提出了一个基于轻量级多模态大语言模型(MLLM)的多智能体协作框架,专门用于社会智能推理。我们方法的一个关键特点是训练和推理阶段均通过知识蒸馏增强。在该架构中,与社会智能相关的多模态数据被精确定位。此外,相关的长尾事件被识别、提取并渲染为格式化、显式的文本。这种格式化策略防止了关键的长尾信息在令牌化过程中被头部事件和环境噪声掩盖。具体而言,我们将测试时自适应(TTA)整合到整个推理流程中,包括长尾事件的提取和表示、思维链(CoT)提示和自我反思。该TTA机制也通过蒸馏增强,利用低秩适应(LoRA)仅针对实例级推理对基础模型进行微调。与各种开源和专有AI模型在多个基准上的广泛评估证明了所提出框架的有效性。使用约30%的IntentTrain训练数据,我们取得了最先进的结果。代码见 https://github.com/eeee-sys/MODF-SIR,演示见 https://huggingface.co/spaces/Harry-1234/MODF-SIR,LoRA权重见 https://huggingface.co/Harry-1234/MODF-SIR,训练路由器的数据集见 https://huggingface.co/datasets/Harry-1234/IntentRouterTrain。 ## I 引言 社会智能是指智能系统基于多模态社会信号(如口头语言、面部表情、副语言及身体动作)推断和理解人类意图、情感、人际动态及隐含社会规范的认知过程。这是人工智能中一个基础且具有挑战性的问题[31 (https://arxiv.org/html/2606.12018#bib.bib34)]。在现实场景中,人类很少通过明确且完全指定的指令进行交流。相反,意图通过语言、视觉线索、动作和社会背景的组合含蓄地传递[40 (https://arxiv.org/html/2606.12018#bib.bib40)]。因此,智能系统必须超越表层感知,发展推断潜在目标、解读人际动态以及对不断演变的交互过程进行推理的能力[33 (https://arxiv.org/html/2606.12018#bib.bib41)]。重要的是,人类意图通过诸如言语、面部表情、身体动作和环境证据等多种信号表达,这些信号紧密耦合且随时间动态演化[40 (https://arxiv.org/html/2606.12018#bib.bib40)][8 (https://arxiv.org/html/2606.12018#bib.bib43)]。因此,有效的意图理解需要整合感知和动作线索,并显式建模它们的交互,而不是独立处理[8 (https://arxiv.org/html/2606.12018#bib.bib43)][45 (https://arxiv.org/html/2606.12018#bib.bib46)]。除了多模态整合,该问题深深植根于社会认知和心理理论。人类通过推理他人的信念、目标和内部状态来推断其意图,这一过程由动作理解和更高级的心智化机制支持,这些机制根据交互上下文动态参与。因此,情感分析不仅要考虑个体行为,还要考虑多智能体动态、共享目标和上下文依赖,使其比传统感知任务复杂得多[5 (https://arxiv.org/html/2606.12018#bib.bib44)]。 参见图 1:我们方法的动机。传统方法采用黑盒推理范式,可能导致幻觉等问题。我们的方法采用多智能体策略,可视化推理步骤。 为克服这些局限,本文提出一个基于轻量级MLLM、经蒸馏增强的多智能体协作框架,用于社会智能推理,称为多智能体全模态蒸馏框架用于社会智能推理(MODF-SIR),具有以下特点: (i) MODF-SIR 对全模态数据采用两阶段检索机制。初始检索由提示引导的基础模型(ELT检索智能体)执行,后续检索由蒸馏增强的模型(OMLT推理智能体)执行。受心理学“双过程理论”[20 (https://arxiv.org/html/2606.12018#bib.bib30)]启发,第一阶段作为粗粒度过程(系统1),旨在为AKD路由智能体的路由决策提供信息。相反,第二阶段是细粒度过程(系统2),支撑OMLT推理智能体的社会智能推理。关键的是,两个检索阶段的结果都被序列化为自然语言。这种文本化显式强调了与社会智能相关的长尾事件,从而防止这些关键信号在令牌化过程中被主导的头部事件或背景噪声掩盖。 (ii) 在OMLT检索智能体输出的引导下,MODF-SIR中的AKD路由智能体决定后续的推理范式。它动态将过程路由到标准推理或社会智能推理,后者专门针对全模态数据中的长尾事件。这种条件路由机制确保了计算资源的最优分配。 (iii) 长尾事件本质上是微妙且短暂的。因此,对无约束的全模态数据进行详尽的全域搜索以识别这些事件会给MODF-SIR带来难以承受的计算开销。为缓解这一问题,框架引入了GRPO定位智能体,该智能体精确定位与用户查询最相关的数据片段,从而显著缩小有效搜索空间。 (iv) MODF-SIR框架内的推理过程分为三个不同阶段,由OMLT推理智能体和TTA修正智能体协作执行。初始阶段,OMLT推理智能体对由GRPO定位智能体定位的全模态数据片段执行检索。此步骤旨在提取与查询相关的出现,显式优先考虑对社会智能推理必不可少的长尾事件。同时,框架包含一个教师引导的评估循环。一个外部大模型充当教师,评估检索结果的质量。如果评估表明性能欠佳,则基础模型通过低秩适应(LoRA)动态更新参数,并迭代重新执行检索,直到完全满足教师模型的标准。在第二阶段,OMLT推理智能体利用检索到的证据执行查询驱动的思维链(CoT)推理。与前一阶段类似,生成的推理轨迹由外部教师评估。次优输出会触发基于LoRA的迭代参数更新和CoT重新生成,直至完全满足教师标准。最后,TTA修正智能体评估OMLT推理智能体的输出。次优答案会触发基于LoRA的参数更新及随后的重新推理。此自我纠正模块显式利用著名的“生成-评估差距”[50 (https://arxiv.org/html/2606.12018#bib.bib22)],利用LLM在评估输出方面天生比生成输出更擅长的共识。 与TTA修正智能体类似,MODF-SIR在推理过程中的参数更新构成测试时自适应(TTA)。具体来说,MODF-SIR根据当前的全模态输入和查询应用特定实例的LoRA更新。推理结束后,这些LoRA权重被丢弃,完全恢复基础模型。为评估我们方法的有效性,我们在三个基准上进行了测试,包括Worldsense[15 (https://arxiv.org/html/2606.12018#bib.bib82)]、Daily-omni[51 (https://arxiv.org/html/2606.12018#bib.bib83)]、IntentBench[46 (https://arxiv.org/html/2606.12018#bib.bib1)]。利用多智能体设计共同产生时间定位的证据和准确响应,我们的框架在建模人类意图和心理动态方面展示了强大能力。总体而言,我们的贡献如下: - • 我们提出MODF-SIR,一个统一的全模态推理框架,率先将多智能体协作应用于社会智能推理领域。我们的框架通过路由智能体引入动态策略选择,使模型能够根据输入复杂度自适应决定是否执行时间定位或直接推理。 - • 我们引入GRPO定位智能体和TTA修正智能体。我们使用GRPO算法训练通过自回归方法实现的视频定位器,并在测试期间使用测试时适应和带基线的REINFORCE算法微调推理模块。该方法使我们的框架具备样本级回答能力。 - • 我们通过知识蒸馏构建了新的多智能体路由训练数据。该蒸馏数据为训练AKD路由智能体提供了高质量伪标签,显著增强了其决策能力。使用约30%的IntentTrain[46 (https://arxiv.org/html/2606.12018#bib.bib1)]训练数据,我们取得了最先进的结果。 - • MODF-SIR在三个基准上取得了最先进的结果:IntentBench[46 (https://arxiv.org/html/2606.12018#bib.bib1)]、Daily-Omni[51 (https://arxiv.org/html/2606.12018#bib.bib83)]、WorldSense[15 (https://arxiv.org/html/2606.12018#bib.bib82)]。值得注意的是,我们的方法超越了众多商业闭源和开源模型,包括GPT-4o[16 (https://arxiv.org/html/2606.12018#bib.bib87)]、Gemini-2.5-Pro(思考)[12 (https://arxiv.org/html/2606.12018#bib.bib93)]。广泛的消融实验进一步证实了其有效性。 ## II 相关工作 ### II-A 视频中的时间定位与推理 视频理解的显著进展使得一系列任务成为可能,包括视频字幕生成、视频问答和视频-文本检索,这些任务主要关注视觉内容的语义级理解[42 (https://arxiv.org/html/2606.12018#bib.bib77)][18 (https://arxiv.org/html/2606.12018#bib.bib78)]。然而,这些方法通常缺乏查询与视觉证据之间的细粒度时间对齐,限制了其提供精确且可解释推理的能力,尤其是在长而复杂的视频中。时间定位任务解决了这一局限。现有方法在时间定位方面已取得强性能。尽管如此,这些模型主要针对边界预测进行优化,往往无法捕捉底层推理过程或为其预测提供可解释的理由[25 (https://arxiv.org/html/2606.12018#bib.bib80)]。视频推理和基于事实的问答的最新进展进一步凸显了将时间定位与高层推理相结合的必要性。这些任务要求模型不仅识别相关片段,还要对时间分布的证据进行多步推理。 ### II-B 模型优化 模型优化已成为提升LLM超越标准单次推理性能的重要范式。早期方法侧重于推理时优化,其中模型通过自一致性、工具增强推理和结构化搜索等策略迭代改进其输出[43 (https://arxiv.org/html/2606.12018#bib.bib55)][36 (https://arxiv.org/html/2606.12018#bib.bib81)]。另一条研究路线利用强化学习(RL)通过奖励信号优化模型行为来增强推理能力[30 (https://arxiv.org/html/2606.12018#bib.bib74)]。最近的进展表明,RL可以显著改善多步推理和决策过程。尽管如此,这些模型大多严重依赖视觉相关任务,忽视了全模态信息。与此同时,参数高效微调技术(如低秩适应)提供了一种以最小计算开销更新模型参数的实用方法。虽然有效,但这些方法主要设计用于离线适应,很少被集成到用于连续优化的迭代推理框架中。 ## III 方法 参见图 2:我们的MODF-SIR的整体工作流程。给定视频、音频和查询,MODF-SIR会根据不同情况激活不同的智能体,并执行逐步推理。 ### III-A 框架 在处理复杂的现实人类交互时,MLLM通常依赖于扁平的、黑盒式的端到端推理范式[37 (https://arxiv.org/html/2606.12018#bib.bib2)]。当面对长时间、信息密集的音视频流时,这种范式常常遭受严重的“认知过载”[22 (https://arxiv.org/html/2606.12018#bib.bib32)],损害模型捕捉隐含人类意图、微妙情感动态和演变心理状态的能力。此外,缺乏自我反思机制意味着时空定位中的早期幻觉可能会传播,导致下游推理中出现不可逆的错误级联[52 (https://arxiv.org/html/2606.12018#bib.bib33)][19 (https://arxiv.org/html/2606.12018#bib.bib31)]。 为解决这些局限,我们受“双过程理论”[20 (https://arxiv.org/html/2606.12018#bib.bib30)]启发,提出了MODF-SIR(图2 (https://arxiv.org/html/2606.12018#S3.F2)),一个专为社会智能推理设计的的多智能体协作框架。它在训练和推理中利用了知识蒸馏,同时结合TTA和Episodic LoRA进行实例级自我纠正推理。MODF-SIR旨在提取和分析长尾多模态事件(如微妙的行为或面部变化),以解码人类意图和情感。通过扩展的CoT推理,它回答关于情感和意图动态的隐式用户查询。框架
相似文章
基础模型中的集体智能
本文提出了一种多智能体推理框架,其中多个基础模型通过结构化批评和聚合进行协作,表明模型异构性显著提高了逐步推理的准确性并减少了跨领域的方差。
OmniThoughtVis:一种用于部署型多模态推理模型的可扩展蒸馏流水线
本文介绍了 OmniThoughtVis,这是一种可扩展的流水线,用于将多模态推理能力从大型教师模型蒸馏到更小、面向部署的多模态大语言模型(MLLMs)中。该方法利用精心策划的思维链(chain-of-thought)数据,显著提升了从2B到8B参数规模模型在 MathVerse 和 MMMU-Pro 等基准测试上的推理性能。
MER-R1: 通过慢速-快速思维协同的多模态情感推理
本文介绍了MER-R1,一个通过协同快速和慢速思维进行多模态情感识别的强化学习框架。它通过双目标解耦和慢速-快速置信度校准,联合优化召回率和精确率,从而实现了最先进的性能。
基于符号图建模的冲突鲁棒多智能体推理
本文提出SIGMA,一种基于符号图的多智能体推理框架,显式建模LLM智能体之间的信任、冲突和中性关系,以实现冲突鲁棒且全局一致的预测,在六个基准测试上优于最先进的基线方法。
社会思维链:一种基于医学鉴别诊断方法论的多智能体架构
这篇arXiv论文介绍了社会思维链(SCoT),一种用于医学鉴别诊断的多智能体架构,它将多轮专家对话组织成结构化流程。评估显示,它优于单智能体和整体式推理,尤其是在最困难的诊断案例上。