@mylifcc: 语音 Agent 正在爆发,生产里却大多还是黑盒。 昨天(7月21日)LangSmith 正式上线了 Python 端语音 tracing 支持,覆盖目前最主流的 4 个框架: Pipecat LiveKit OpenAI Realtim…
摘要
LangSmith 正式上线 Python 端语音 tracing 支持,覆盖 Pipecat、LiveKit、OpenAI Realtime 和 Gemini Live 四个主流框架,将语音对话纳入与文本 Agent 同一套可观测、可评估的工作流,解决了语音 Agent 可调试性差的痛点。
查看缓存全文
缓存时间: 2026/07/22 20:36
语音 Agent 正在爆发,生产里却大多还是黑盒。 昨天(7月21日)LangSmith 正式上线了 Python 端语音 tracing 支持,覆盖目前最主流的 4 个框架:
Pipecat LiveKit OpenAI Realtime Gemini Live(Google ADK)
这不是简单加个 log,而是把语音对话真正纳入了和文本 Agent 同一套可观测、可评估、可协作的工作流。对认真做 agent 工程的人来说,意义很大。
先说痛点,为什么之前语音 Agent 特别难调。 文本 Agent 的 trace 大家已经习惯了:模型输入输出、tool call、中间状态、token 消耗,一眼能看清决策路径。 语音完全不同。它是实时、双向、可打断的。用户会中途插话、重叠说话、改变话题,对延迟极度敏感。常见的两种架构:
Sandwich(夹心)架构:STT → 文本 Agent → TTS。每一轮都要过这三层,延迟是累加的,任何一层出问题都很难定位。 Speech-to-Speech(端到端)架构:多模态模型直接吃音频、吐音频(OpenAI Realtime、Gemini Live 这类),中间事件是 websocket 流:audio chunk、转录片段、tool call、打断信号……没有清晰的「请求-响应」边界。
以前这些东西要么完全看不见,要么散落在各自框架的 span 里,和业务逻辑脱节。出了问题你只能听录音猜。
LangSmith 现在怎么做的。 它把整段对话当成一个完整的 trace(而不是拆成很多零散的 run),并重点解决了语音特有的可观测需求:
完整对话音频可以直接 overlay 在 trace 上(用户说话 + Agent 回复,真实播放给客户端的那个版本,包含打断效果) STT / LLM / TTS 各阶段的 latency 拆解,能直接看到哪一层拖慢了 turn Voice Activity Detection 事件、打断、重叠说话 工具调用的参数、结果、错误 高层次的 user/agent turn 结构 元数据、输入输出、决策路径
Sandwich 和 Speech-to-Speech 两种架构都支持。集成成本很低,官方说基本就是几行代码(Pipecat、LiveKit 是 hook 已有 span;Realtime 和 Gemini Live 是直接吃事件流)。
我认为这事值得认真关注。
统一工作流 文本 Agent 和语音 Agent 终于能放在同一个 LangSmith 项目里 review、加 human feedback、跑 evaluation。之前很多团队是「文本用一套工具,语音另搞一套」,协作成本极高。 生产级调试真正变成可能 语音的失败模式很独特:延迟尖刺、打断处理不当、转录错误导致后续推理跑偏、工具调用时机不对……这些以前只能靠听录音 + 猜。现在可以精确到事件级别回放。 对 agent 工程的启示 可观测性从来不是「加个 tracing 库」那么简单,而是要把真实的交互单元(对话、打断、时序)正确建模。语音把这个问题推到了更极端的位置——实时性、多模态、双向状态。做文本 agent 时积累的那些 quality gate、self-check、context 管理经验,在语音场景下会被放大检验。 市场节奏 语音模型(尤其是低延迟、支持打断的)进步很快,应用层正在从 demo 冲向真实业务(客服、陪伴、操作助手等)。这时候谁先把 observability 和 evaluation 做好,谁就能更快迭代出可用产品。
相似文章
@LangChain: 你可以将现有的 LangGraph 代理变成一个功能完整的语音代理,配合 @pipecat_ai。这个17分钟的演示……
LangChain 宣布可以使用 Pipecat AI 将现有的 LangGraph 代理转换为语音代理,同时更新了 LangSmith 的语音追踪功能,新增了内联音频播放器。
@LangChain:追踪中的完整音频、STT/TTS 延迟、中断 + VAD,仅需几行代码即可设置
LangChain 推出面向语音框架(Pipecat、LiveKit、OpenAI Realtime、Gemini Live)的 LangSmith 追踪功能,支持完整音频监控、STT/TTS 延迟跟踪、中断检测和 VAD 分析,且仅需极少量代码。
@interjc: 这么好的语音功能在桌面端推出了,怎么着也要重置一次以示庆祝吧
OpenAI在桌面端推出了ChatGPT语音功能,支持语音控制电脑和协调多个代理,基于GPT-Live,即日起全球上线。
This is the new ChatGPT Voice, powered by GPT-Live
OpenAI发布了由GPT-Live驱动的新一代ChatGPT语音功能,实现全双工实时对话,支持打断、智能推理、网络搜索和实时翻译,交互更自然智能。
Listening & Speaking with GPT-Live
OpenAI 展示了新语音模型 GPT-Live 的实时同声传译与对话能力,能够同时听和说,并在翻译与聊天之间无缝切换。