标签
Intern-Decision 4B 和 0.8B 是从 Qwen3.5-4B 微调而来的多模态结构化决策模型,旨在单次前向传播中返回多个问题的答案分布,并具有强大的基准性能。
ArGuard 是一个专注于检测阿拉伯语模因与 LLM 提示中有害内容的共享任务,突出了细粒度分类中的挑战,并发布数据集以供进一步研究。
Gemini 3.8 Live 搭配 Live Avatar 为对话式AI带来了实时视觉呈现,允许企业通过动态化身和多语言支持创建更自然、交互性更强的数字体验。
一条推文建议使用Gemini 3.8 Flash进行多模态理解,并引用了一个视觉测试,该测试比较了AI模型从绘画中识别人物的能力。
FLUX 3 Action 是一款开放权重的 7B AI 模型,在 RoboLab 基准测试中树立了新标准,其性能超越了之前的开源模型,同时速度更快、效率更高,适用于机器人技术以及其他需要视觉动作规划的环境。
名为 Space Bunny 的秘密多模态 AI 模型已在 OpenCode 中发布,可免费试用,发布公司未知
小米的 MiMo V2.6 Pro 现在是 Artificial Analysis 上全球排名第一的开源 AI 模型,在智能指数上几乎与 GPT-5.6 Sol 持平,同时为实际应用提供了成本效益高的定价。
Jev-Omni 是第一个将类型化决策扩展到多模态的开放权重模型,支持文本、图像、音频和视频,直接返回选项的概率分布而不生成解释。
本文介绍了ReFigBench,这是一个用于评估编码智能体将科学图表重建为可编辑PowerPoint幻灯片的基准测试,表明工具对不同模型家族的性能有显著影响。
PixVerse R2 引入了一种统一的缩放架构,用于实时视听世界模型,利用块稀疏注意力机制和持续预训练来增强视频生成和交互控制。
dots3-note Preview 是一个多模态 Mixture-of-Experts AI模型,具有280B总参数和16B激活参数,支持多达512K token上下文,在Hugging Face上作为开源权重模型发布。
Xiaomi已开源MiMo-V2.6系列,推出两款全模态AI模型Pro和Flash,性能可与顶级专有模型媲美,并适用于各种应用。
MiMo-V2.6-Flash-RL 是一个多模态AI模型,通过扩展强化学习实现自我改进,采用稀疏混合专家架构,总参数3090亿,上下文长度为100万令牌。
本文提出RRDrive,一种用于基于寄存器的端到端自动驾驶的风险感知占用表示,该表示在复杂场景中改进了轨迹预测和选择,取得了显著的性能提升。
本文介绍了Omni Demand Understanding (ODU),一个评估多模态AI模型如何从复杂音视频交互中推断用户需求的基准测试,揭示了当前模型中显著的性能差距。
VisPath 引入了一种视觉意图引导的路径推理框架,用于多模态知识图谱问答,在新的基准 VisPath-Bench 和现有数据集上取得了显著改进,超越了基线方法。
本文提出了VideoGen-Agent,一种基于强化学习的多模态智能体,它协调工具进行视频生成,在新的VABench基准测试上显著提升了性能。
Jev-Omni 是一个基于 Gemma 4 12B IT 构建的多模态决策分类器,经过微调以处理文本、图像、音频和视频,根据问题为选项提供概率分数。
Jina-ocr-v1是一款专为高级文档智能设计的多模态视觉语言模型,能够从多语言图像中读取文本。
一位用户分享了从Astra切换到ds v4.1 flash的积极体验,强调了其多模态能力和快速速度。