标签
一条推文建议使用Gemini 3.8 Flash进行多模态理解,并引用了一个视觉测试,该测试比较了AI模型从绘画中识别人物的能力。
FLUX 3 Action 是一款开放权重的 7B AI 模型,在 RoboLab 基准测试中树立了新标准,其性能超越了之前的开源模型,同时速度更快、效率更高,适用于机器人技术以及其他需要视觉动作规划的环境。
名为 Space Bunny 的秘密多模态 AI 模型已在 OpenCode 中发布,可免费试用,发布公司未知
小米的 MiMo V2.6 Pro 现在是 Artificial Analysis 上全球排名第一的开源 AI 模型,在智能指数上几乎与 GPT-5.6 Sol 持平,同时为实际应用提供了成本效益高的定价。
Jev-Omni 是第一个将类型化决策扩展到多模态的开放权重模型,支持文本、图像、音频和视频,直接返回选项的概率分布而不生成解释。
本文介绍了ReFigBench,这是一个用于评估编码智能体将科学图表重建为可编辑PowerPoint幻灯片的基准测试,表明工具对不同模型家族的性能有显著影响。
PixVerse R2 引入了一种统一的缩放架构,用于实时视听世界模型,利用块稀疏注意力机制和持续预训练来增强视频生成和交互控制。
dots3-note Preview 是一个多模态 Mixture-of-Experts AI模型,具有280B总参数和16B激活参数,支持多达512K token上下文,在Hugging Face上作为开源权重模型发布。
Xiaomi已开源MiMo-V2.6系列,推出两款全模态AI模型Pro和Flash,性能可与顶级专有模型媲美,并适用于各种应用。
MiMo-V2.6-Flash-RL 是一个多模态AI模型,通过扩展强化学习实现自我改进,采用稀疏混合专家架构,总参数3090亿,上下文长度为100万令牌。
本文提出RRDrive,一种用于基于寄存器的端到端自动驾驶的风险感知占用表示,该表示在复杂场景中改进了轨迹预测和选择,取得了显著的性能提升。
本文介绍了Omni Demand Understanding (ODU),一个评估多模态AI模型如何从复杂音视频交互中推断用户需求的基准测试,揭示了当前模型中显著的性能差距。
VisPath 引入了一种视觉意图引导的路径推理框架,用于多模态知识图谱问答,在新的基准 VisPath-Bench 和现有数据集上取得了显著改进,超越了基线方法。
本文提出了VideoGen-Agent,一种基于强化学习的多模态智能体,它协调工具进行视频生成,在新的VABench基准测试上显著提升了性能。
Jina-ocr-v1是一款专为高级文档智能设计的多模态视觉语言模型,能够从多语言图像中读取文本。
一位用户分享了从Astra切换到ds v4.1 flash的积极体验,强调了其多模态能力和快速速度。
Lillian Ma 在湾区的一家博物馆举办了一场大型多模态活动,展示了 Inference、MCP 和 AgentBox 等产品,有超过200名来自合作伙伴公司的参与者。
本文提出了针对SpeechLLMs的情感识别判别式适配方法,通过在线性分类头上使用最终提示词token的隐状态,提升性能和可解释性,消除幻觉并增强情感方向分析。
Qwen3.8-Omni-Flash是一款全模态AI模型,拥有百万token上下文窗口,支持文本、图像、音频和视频输入,性能与Gemini 3.8 Flash相当或更优,现已在Qianwen AI平台上线。
Alibaba 已发布 Qwen 3.8 Omni Flash AI 模型,该模型可能具备多模态能力,并针对速度进行了优化。