标签
这篇综述论文评估实时语音代理,通过提出一个分类法和一个名为TRG的最低报告标准,以解决语音建模、轮次转换和代理评估社区中的碎片化问题。
一个具有实时虚拟形象的开源语音AI代理能够实时看、说、思考和绘画,并支持多语言交互,例如在通话中途切换到印地语。
一个免费的网页应用,将动画像素艺术城市夜景与使用AI在浏览器中实时生成的无尽lofi音乐配对,为工作或放松提供平静的背景。
Google 推出 Gemini 3.8 Live with Live Avatar,这是一项更新,将实时视觉虚拟形象集成到对话式 AI 中,通过唇形同步、多语言支持和异步工具执行等功能增强交互,适用于企业应用。
OdysseyML 推出了 Agora-2,一个下一代多智能体世界模型,支持多达20个人类和智能体在共享模拟环境中实时互动,多人研究预览现已可用。
NVIDIA 发布了 Nemotron 3 Diarization,这是一个开源100M参数模型,实现了最先进的说话人识别,错误率为14.72%,支持最多八名说话人的实时和离线处理。
开源 Audio8 ASR Infinite,一种具有超低延迟、无限制音频支持、24/7转录和内置语义轮次检测的语音识别工具,据称是流式ASR的新技术标杆。
OpenTrainDNN 是一个开源的客户端Web应用,它能在浏览器中实时可视化深度神经网络的训练过程,包括反向传播和权重更新。
使用Claude Opus 5.5生成的提示词可创建一个鹈鹕骑自行车的交互式3D场景,包含物理模拟、成就系统及基于浏览器的实时音效。
NetEase Youdao的开源AI模型R2T2和T3PO在Hugging Face的语音识别和翻译排行榜上名列前茅,凭借令人印象深刻的实时性能和稳定性超越了主要竞争对手。
PixVerse R2 引入了一种统一的缩放架构,用于实时视听世界模型,利用块稀疏注意力机制和持续预训练来增强视频生成和交互控制。
InstinctFlash是一个高性能的机器人模型服务框架,可在Jetson Thor上实现实时推理5B世界动作模型,据报道速度提升高达33.78倍。
Yohei Nakajima 发推分享了一种快得足以用于实时情感检测的技术,强调其性能为实时。
这篇帖子比较了 AI 模型 Jev 和 Laya,突出了 Laya 在实时游戏决策中的开源、本地和低延迟能力。
Marcus Ng和Jamie Cai通过构建Adlib赢得了$10k并成为HackTheNorth的半决赛选手。Adlib是一个工具,可以从口语实时创建流程图、图表和图形,以替代传统的幻灯片。
R2T2 是一个低延迟、高精度的实时语音识别模型,它以小块处理音频并直接提交文本,无需修改,适用于实时字幕和翻译等应用。