@kwindla: Pipecat v1.8.0 今日发布,提供对 Gemini 3.5 Transcribe 的首发支持,这是 Google 基于 Gemini 的全新转录模型。
摘要
Pipecat v1.8.0 已发布,包含重大更新,如支持 Gemini 3.5 Transcribe、改进的错误处理、更快的管道启动以及多种新集成。
查看缓存全文
缓存时间: 2026/08/27 21:41
Pipecat v1.8.0 今日发布,首日即支持 Google 基于 Gemini 的全新转录模型 Gemini 3.5 Transcribe。
这是一次重大的 Pipecat 版本更新,更新日志包含 233 项条目。
主要亮点包括:
错误处理与服务故障转移的改进: 处理器现可报告自身不再可用的状态,错误分类更加清晰,且 ServiceSwitcher 仅在服务确实无法恢复时才会执行故障转移。STT/TTS 服务也不会再对无效 API 密钥或模型等永久性错误进行无尽重试。
更快的流水线启动速度: 流水线设置已围绕新的 setup() 生命周期进行重构,允许处理器和服务在流水线启动前并发初始化和连接。结合导入时间的优化,这显著减少了启动时间,尤其对于大型流水线效果更为明显。
更灵活的轮次管理: 内置轮次检测的服务现在会建议轮次边界,而 Pipecat 的轮次策略则做出最终决定。这使得轮次管理和中断处理得以统一,并让提供商原生的轮次检测更易于自定义。
Pipecat Evals 功能更强大: 开发过程中即可运行场景,以迭代方式测量通过率,获取机器可读的 results.jsonl 结果文件,单独评估轮次,运行整个场景目录等。这对于测量中断和异步函数调用等非确定性行为非常有用,无需仅测试一次然后祈祷效果良好。
更好的编码智能体体验: Pipecat Context Hub 现已包含在 CLI 中并与 pipecat init 集成,包括为支持的编码智能体提供自动设置,并执行新鲜度检查以帮助防止智能体基于过时的 Pipecat API 生成代码。
LLM 现可取消函数调用: 长时间运行的异步工具可以选择启用 LLM 驱动的取消,超时的函数调用现在会自动取消,而不是继续在后台运行。
新增多种服务支持: Speechify TTS、ElevenLabs Dialogue TTS、Bland TTS、Sarvam Realtime STT、SageMaker 上的 Deepgram Flux、OpenClaw Gateway 支持、LiveKit 运行器支持、用于通过中继连接机器人的 MoQ 客户端模式(包括 NAT 后部署)等。
当然,框架中还有大量修复和较小的改进,涵盖流水线启动/清理、指标、TTS 跟踪、传输层、实时服务和轮次处理等方面。
衷心感谢社区中的每一位成员,是你们让这一切成为可能!Pipecat 集成现已超过 180 个。
祝编码愉快!
相似文章
Gemini 3.8 Live 和 3.5 Transcribe(1分钟阅读)
Google 发布了新的 Gemini 模型,包括 Gemini 3.8 Live 和 3.5 Transcribe,旨在增强实时语音应用,为开发者提供改进的对话式 AI 和多语言转录功能。
Gemini 3.5 Transcribe 智能转录
Google 推出 Gemini 3.5 Transcribe,这是一款新的 AI 模型,提供精确且智能的实时语音转文本转录,开发者可通过 API 获取。
@GoogleDeepMind: Gemini 3.5 Transcribe 是我们最新的语音转文本模型,用于精确和智能的转录。
Google DeepMind 宣布 Gemini 3.5 Transcribe,这是一个新的语音转文本模型,用于精确和智能的转录。
Gemini 3.5 Transcribe
Gemini 3.5 Transcribe 被宣布为目前最精确的语音转文本模型,并在Product Hunt上提供了讨论链接。
Google宣布推出Gemini 3.5 Transcribe,用于AI驱动的语音转文本
Google已宣布Gemini 3.5 Transcribe,这是一款用于语音转文本的AI模型,通过移除如“嗯”这样的填充词并支持85种语言来提高速度和准确性,正在其生态系统中推出。