标签
YouTube在Made on YouTube活动上宣布了新功能,包括自定义订阅源和增强的AI功能,如Ask YouTube和Ask Music,计划于今年晚些时候推出。
开源 Audio8 ASR Infinite,一种具有超低延迟、无限制音频支持、24/7转录和内置语义轮次检测的语音识别工具,据称是流式ASR的新技术标杆。
NetEase Youdao发布了两款AI模型:一款是2B参数的流式ASR模型,另一款是14B参数的中英同声传译模型,均强调实时性能。
本文针对使用vLLM部署MiMo-V2.6-Flash模型时遇到的三个错误提供识别方法与解决方案,包括流式模式下的空响应、工具循环中的推理损失,以及隐藏的token输出上限问题。
一位开发者构建了一个小型网关,通过处理流式处理、工具调用以及跨模型如Claude和GPT的提供商特定集成挑战,来简化多模型智能体工作流。
本文介绍了SVEET,一个用于高质量流式视频编辑的框架,它利用预训练的视频扩散模型,实现自动回归编辑,并在单个GPU上实现实时性能。
R2T2 是一个低延迟、高精度的实时语音识别模型,它以小块处理音频并直接提交文本,无需修改,适用于实时字幕和翻译等应用。
四届F1世界冠军马克斯·维斯塔潘将尝试在银石赛道进行一场30圈的赛事,对抗100辆相同的卡丁车,由红牛、迪士尼+和ESPN直播。
本文介绍了Zing-0.5,一个50亿参数的自回归世界模型,用于生成可通过键盘和文本控制实时交互的可玩世界。它在导航任务中表现出高性能,并展示了以24 FPS进行低成本实时推理的能力。
Netflix宣布三款新的Sega游戏改编作品:一部《Crazy Taxi》电影,一部面向有态度儿童的《Sonic》动画剧集,以及一部基于即将推出的《Stranger Than Heaven》的真人电影。
Omni-Streaming Thinking 通过推迟声明直到跨模态验证来改进流式全模态推理,减少过早承诺和听觉幻觉。
GPT6 Astra,一个AI模型,正在玩Factorio Space Age,已经到达第三颗星球,超过了之前的模型Fable 5.1。有直播可用,预计很快完成游戏。
Confucius4-R2T2 是网易有道开发的一款低延迟、高精度的实时语音识别模型,具有可配置的分块功能和稳定输出,适用于实时字幕等应用场景。
StreamAlign 是一个流式文本对齐语音分词框架,能够实现语音-文本联合建模的实时处理,降低延迟,并在语音识别和口语建模任务上达到最先进的性能。
Prime Video 发布了 Mike Flanagan 六集迷你剧改编自 Stephen King 的 Carrie 的完整预告片,旨在为现代世界重新诠释这个故事。
NVIDIA 在 IBC 2026 上宣布扩展 NVIDIA AI for Media,包括先进的 Synthetic Video Detector 和 3D Body Pose 技术,以增强广播、体育和流媒体中的 AI 应用。
Amazon Prime Video 推出了一项 AI 驱动的功能,可同步演员口型与配音音频以提升配音质量,该功能最初适用于剧集 Maxton Hall,并计划扩展到更多内容。
微软对Xbox Game Pass订阅者的游戏流媒体施加新的月度时间限制,不同层级提供每月5至15小时,额外流媒体时间可购买。
微软发布VibeVoice-ASR-Streaming,这是一款统一的流式自动语音识别模型,能够转录说话人身份,并支持自定义热词和10种语言。