标签
泄露图片和细节揭示了索尼即将推出的十周年纪念版ColleXion耳机,采用高级设计、更新音频驱动,售价649美元,预计5月19日发布。
AudioMosaic 提出了一种基于对比学习的音频编码器,通过对频谱图块应用结构化时频掩码来构建正样本对,实现高效的大批量训练,在音频基准测试中达到最先进性能,并提升了音频-语言模型的效果。
作者描述了测试一个智能体工作流程,该流程将提示转化为音频课程以发布到Spotify,潜在用途包括会议简报、团队更新和学习笔记。
OpenAI宣布其播客现已上线主流流媒体平台,包括Spotify、Apple Podcasts和YouTube。
OmniGUI引入了一个针对GUI智能体的步骤级基准测试,该测试整合了静态图像、同步音频和视频片段,以模拟真实的智能手机交互。评估显示,当前模型在处理时序和听觉输入方面存在困难,凸显了对全方位模态能力的需求。
OpenAI 发布了 GPT-4o 系统卡,详细介绍了在网络安全、生物威胁、说服力和模型自主性等方面的全面安全评估和风险缓解措施。这个多模态模型在准备框架类别中得分为低至中等,并为音频功能采用了新颖的防护措施。