为LLM智能体设计的音频感知层,拥有随使用而增长的记忆
摘要
一个实验性开源框架,使LLM智能体能够使用本地模型(CLAP、Whisper、Silero VAD)和不断增长的概念记忆来感知并识别非语音音频事件。该系统采用事件门控识别、指纹识别和基于符号的推理,目前尚无正式基准测试。
LLM在运行语音转文本后可以很好地处理语音。但它们无法听到其余声音:窗外的鸟鸣、两个房间外的玻璃碎裂声、楼下两层的烟雾报警器。我一直在开发一个实验性开源框架,旨在弥补这一差距:持续音频输入,事件门控识别输出,以及随使用而增长的概念记忆。整个感知栈在本地运行:CLAP、Whisper、Silero VAD、sqlite-vec。分类器通过fast-agent运行,因此任何LLM提供商(包括Ollama本地)都适用。https://i.redd.it/6rv9qvv0cfdh1.gif 该循环大致模拟了听觉的工作原理: 门控——能量/新奇性/Silero-VAD将连续流修剪为候选区域。大多数音频永远不会到达系统的其余部分。 指纹——CLAP嵌入 + 约二十个符号特征(频谱形状、谐波、峰值、时间漂移)。 识别——sqlite-vec基于已学习概念进行top-k余弦相似度搜索。与校准概念强匹配时,触发服务器端响应,无需调用LLM。弱匹配/未匹配则暴露给智能体。 未处理——智能体无法识别的任何内容,连同其指纹和专家猜测一起进入队列,等待教师标注。标注 → 新概念。 智能体在三个符号层上进行推理,而非原始音频:信号特征作为JSON、嵌入相似度得分与记忆的对比、以及专家标签。在足够多的示例后,一个概念会自动校准阈值并移至服务器端快速路径;后续匹配无需调用LLM。无需训练;预训练的CLAP嵌入完成所有工作。目前,它带有三个专家(Whisper、BirdNET、AST);注册表可扩展,支持更多分类器。每个专家都声明一个简明英语合约,以便LLM知道如何使用它们以及何时使用。一些潜在应用:一个机器人对意料之外的撞击做出反应;一个助手听到烤箱仍在蜂鸣;一个工业监控器在轴承故障发生前捕捉到它。这更像是一个有趣的研究项目;仅在我的个人录音上进行了简单评估,尚无正式基准测试。欢迎反馈! - 仓库:https://github.com/es617/audient - 包含图表和演示的文章:https://es617.dev/2026/07/07/audient-ears.html
相似文章
FunAudioLLM:面向人类与LLM自然交互的语音理解与生成基础模型
介绍FunAudioLLM,这是一个模型系列,结合了用于多语言ASR、情感检测和音频事件检测的SenseVoice,以及用于自然语音生成的CosyVoice,通过开源模型和代码实现与LLM增强的语音交互。
Cognis:面向对话式 AI 智能体的上下文感知记忆系统
Lyzr Cognis 推出统一开源记忆系统,融合 BM25 与 Matryoshka 向量搜索并支持版本感知写入,在 LoCoMo 与 LongMemEval 基准上实现 SOTA。
受人类启发的LLM智能体记忆架构
微软研究人员提出了一种受生物学启发的LLM智能体记忆架构,该架构结合了睡眠阶段巩固和基于干扰的遗忘机制,以高效管理持久性记忆。
@DanKornas: 当代理记忆仅仅是对旧笔记的搜索时,它会迅速变得混乱。A-MEM是一种用于LLM智能体的智能体记忆系统,能够…
A-MEM是一个开源的智能体记忆系统,用于LLM智能体,它利用Zettelkasten原则动态组织记忆,通过ChromaDB索引,并支持OpenAI和Ollama后端。
AdMem:面向任务求解智能体的高级记忆系统
本文介绍AdMem,一种面向基于LLM的智能体的统一记忆框架,整合语义记忆、情景记忆和程序性记忆,并采用双层短期与长期存储结构,通过多智能体架构实现自动记忆生成与自适应检索。实验表明,该方法在长程多轮任务中提升了鲁棒性和成功率。