标签
本文介绍了Zing-0.5,一个50亿参数的自回归世界模型,用于生成可通过键盘和文本控制实时交互的可玩世界。它在导航任务中表现出高性能,并展示了以24 FPS进行低成本实时推理的能力。
本文提出Gander,一个用于全交互和智能体任务的端到端框架,通过Cerebellum-Brain架构实现跨多种模态的实时全双工交互。
VoiceMem为语音语言模型引入了一种双脑流式记忆架构,提高了检索准确性、情感个性化和实时效率。
MOSS-VL 是一个专为实时交互设计的开放视觉语言模型家族,使用门控交叉注意力机制在生成过程中处理视觉信息,并在开源模型的流式基准测试中取得顶尖性能。
论文提出了 Super Star,一个用于数字人类在线共语手势生成的实时框架,该框架使用因果多模态自回归模型,结合流式语音和用户反馈以实现持续适应。
LingBot-World 2.0 是一个先进的世界模型,实现了无限制的交互范围、实时720p/60fps视频流、多样化的交互元素,以及一个集成了飞行员和导演智能体的智能体框架。该模型已在Hugging Face上发布,附带有推理代码和技术报告。
AlayaWorld 是一个用于构建可交互生成世界的开源框架,支持实时用户交互和多样化动作。该框架统一了从数据准备到部署的完整开发流程。
Thinking Machines的新研究批评了当前单线程AI交互模型,认为这些模型强制人类进行干净的输入输出循环,限制了人机协作。该实验室提出了一种新的交互模型,支持类似于实时人类对话的连续、多模态协作。
StepAudio 2.5 是一个统一的音频-语言模型,通过利用针对任务定制的基于人类反馈的强化学习来优化共享表示,在自动语音识别(ASR)、文本转语音(TTS)和实时口语交互方面取得了最先进的结果。
回顾2013年的电影《她》,本文探讨了当前AI技术距离复制电影中自主、实时解读的AI还有多远,结论是虽然取得了进展,但完整的意识仍然难以企及。
Thinking Machines AI 宣布推出交互模型的研究预览版,这是一种专为音频、视频和文本领域原生、实时人机协作而设计的全新架构。通过以多流、微轮次设计取代传统的轮流交互界面,该模型旨在让人类始终保持在环,同时提供业界领先的智能水平与响应速度。
Mira Murati 团队展示了全新交互模型预览版,该模型从头训练,原生支持全双工实时音视频对话、即时打断、多语言翻译及动态多任务处理。演示验证了其在低延迟流式交互、多模态感知与并发任务执行方面的核心能力。
MiniCPM-o 4.5 是一个拥有 90 亿参数的多模态模型,具备 Omni-Flow 框架,支持实时全双工交互,使模型能够同时感知并主动响应。其开源性能达到最先进水平,可与 Gemini 2.5 Flash 相媲美,并能在内存低于 12GB 的边缘设备上运行。
OpenAI发布GPT-4o,一个功能全面的多模态模型,可实时处理音频、视觉、文本和视频,平均音频响应延迟为232毫秒。该模型在文本和代码能力上与GPT-4 Turbo相当,同时显著改进了多语言、音频和视觉功能,API成本降低50%。
用户通过GPT-Live实时展示两套穿搭,AI针对见家长场景给出具体服装建议,展示了多轮图像理解与场景化建议能力。