标签
Fish Audio 已获得5200万美元种子轮融资,用于面向创作者和企业开发AI语音模型。这家初创公司年经常性收入(ARR)达2100万美元,拥有800万用户,提供开源和付费语音生成模型,包括其最新的S2.1 Pro API。
OpenAI 宣布推出 GPT-Live,这是一种新一代的语音模型,用于实现自然的人机交互,即将在 ChatGPT 中推出,并诚邀设计合作伙伴测试 API。
OpenAI 宣布推出 GPT-Live,这是一种新一代的语音模型,旨在实现自然的人机交互,并已在 ChatGPT 中逐步推出。
OpenAI 发布了新的全双工语音模型 GPT-Live-1 和 GPT-Live-1 mini,旨在实现更自然的实时对话,支持同时说话和聆听,在轮流发言和上下文处理方面有所改进,并取代 ChatGPT 中的 Advanced Voice Mode。
Flowcat解决了实时语音模型的高成本和有限上下文问题,实现了成本降低4倍、上下文增加7倍的效果。
NielsRogge 将一篇介绍 Moshi 全双工语音模型的博客作为项目页面添加到了 Papers With Code,旨在让更多人了解这一先进架构。
OpenAI推出了三个新的实时音频模型,支持连续、多任务的语音交互,优先考虑长上下文推理、实时翻译和无缝工具使用。