multimodal

标签

Cards List
#multimodal

@_philschmid: Gemini 3.8 Flash. 直接使用Gemini进行多模态理解。

X AI KOLs Following ↗ · 17小时前 缓存

一条推文建议使用Gemini 3.8 Flash进行多模态理解,并引用了一个视觉测试,该测试比较了AI模型从绘画中识别人物的能力。

0 人收藏 0 人点赞
#multimodal

Flux 3 Action: 开放权重 7B 世界动作模型

Reddit r/singularity ↗ · 昨天

FLUX 3 Action 是一款开放权重的 7B AI 模型,在 RoboLab 基准测试中树立了新标准,其性能超越了之前的开源模型,同时速度更快、效率更高,适用于机器人技术以及其他需要视觉动作规划的环境。

0 人收藏 0 人点赞
#multimodal

Space Bunny 是 OpenCode 中的新秘密模型。免费试用,多模态

Reddit r/LocalLLaMA ↗ · 昨天

名为 Space Bunny 的秘密多模态 AI 模型已在 OpenCode 中发布,可免费试用,发布公司未知

0 人收藏 0 人点赞
#multimodal

@heyshrutimishra:小米的 MiMo V2.6 Pro 现在是 Artificial Analysis 上全球排名第一的开源模型。同时也是中国开发的模型中排名第一的…

X AI KOLs Timeline ↗ · 昨天 缓存

小米的 MiMo V2.6 Pro 现在是 Artificial Analysis 上全球排名第一的开源 AI 模型,在智能指数上几乎与 GPT-5.6 Sol 持平,同时为实际应用提供了成本效益高的定价。

0 人收藏 0 人点赞
#multimodal

@yibie: https://x.com/yibie/status/2102565806466912408

X AI KOLs Timeline ↗ · 2天前 缓存

Jev-Omni 是第一个将类型化决策扩展到多模态的开放权重模型,支持文本、图像、音频和视频,直接返回选项的概率分布而不生成解释。

0 人收藏 0 人点赞
#multimodal

@omarsar0: 令人印象深刻的论文,展示了工具对编码智能体结果的影响有多大。工具确实在智能体所获得的内容中扮演了重要角色……

X AI KOLs Following ↗ · 2天前 缓存

本文介绍了ReFigBench,这是一个用于评估编码智能体将科学图表重建为可编辑PowerPoint幻灯片的基准测试,表明工具对不同模型家族的性能有显著影响。

0 人收藏 0 人点赞
#multimodal

@yifanzhang_: 非常有趣的模型架构,使用了块稀疏注意力机制。 https://pixverse.ai/en/blog/pixverse-r2-scaling-r…

X AI KOLs Timeline ↗ · 2天前 缓存

PixVerse R2 引入了一种统一的缩放架构,用于实时视听世界模型,利用块稀疏注意力机制和持续预训练来增强视频生成和交互控制。

0 人收藏 0 人点赞
#multimodal

@AdinaYakup: RedNote 发布不频繁,但每个都很扎实 https://huggingface.co/dots-studio/dots3-note-prev…

X AI KOLs Timeline ↗ · 2天前 缓存

dots3-note Preview 是一个多模态 Mixture-of-Experts AI模型,具有280B总参数和16B激活参数,支持多达512K token上下文,在Hugging Face上作为开源权重模型发布。

0 人收藏 0 人点赞
#multimodal

Xiaomi开源MiMo-V2.6 Pro和Flash模型(2分钟阅读)

TLDR AI ↗ · 3天前 缓存

Xiaomi已开源MiMo-V2.6系列,推出两款全模态AI模型Pro和Flash,性能可与顶级专有模型媲美,并适用于各种应用。

0 人收藏 0 人点赞
#multimodal

XiaomiMiMo/MiMo-V2.6-Flash-RL · Hugging Face

Reddit r/LocalLLaMA ↗ · 3天前 缓存

MiMo-V2.6-Flash-RL 是一个多模态AI模型,通过扩展强化学习实现自我改进,采用稀疏混合专家架构,总参数3090亿,上下文长度为100万令牌。

0 人收藏 0 人点赞
#multimodal

在寄存器上驾驶,在风险上推理:面向基于寄存器的端到端自动驾驶的风险感知占用表示

arXiv cs.AI ↗ · 4天前 缓存

本文提出RRDrive,一种用于基于寄存器的端到端自动驾驶的风险感知占用表示,该表示在复杂场景中改进了轨迹预测和选择,取得了显著的性能提升。

0 人收藏 0 人点赞
#multimodal

Omni Demand Understanding: 多模态交互中上下文用户意图推理的基准测试

arXiv cs.CL ↗ · 4天前 缓存

本文介绍了Omni Demand Understanding (ODU),一个评估多模态AI模型如何从复杂音视频交互中推断用户需求的基准测试,揭示了当前模型中显著的性能差距。

0 人收藏 0 人点赞
#multimodal

VISPATH:面向多模态知识图谱问答的视觉意图引导路径推理

arXiv cs.CL ↗ · 4天前 缓存

VisPath 引入了一种视觉意图引导的路径推理框架,用于多模态知识图谱问答,在新的基准 VisPath-Bench 和现有数据集上取得了显著改进,超越了基线方法。

0 人收藏 0 人点赞
#multimodal

VideoGen-Agent:增强视频生成智能体

Hugging Face Daily Papers ↗ · 4天前 缓存

本文提出了VideoGen-Agent,一种基于强化学习的多模态智能体,它协调工具进行视频生成,在新的VABench基准测试上显著提升了性能。

0 人收藏 0 人点赞
#multimodal

@HuggingModels: OCR刚刚经历了一次重大升级。jina-ocr-v1是一款专为文档智能设计的多模态视觉语言模型。它 rea…

X AI KOLs Timeline ↗ · 6天前 缓存

Jina-ocr-v1是一款专为高级文档智能设计的多模态视觉语言模型,能够从多语言图像中读取文本。

0 人收藏 0 人点赞
#multimodal

@Saccc_c: 说实话,实际上,大多数人在大部分工作中并不真正需要Astra。我一直在使用ds v4.1 fla…

X AI KOLs Following ↗ · 6天前 缓存

一位用户分享了从Astra切换到ds v4.1 flash的积极体验,强调了其多模态能力和快速速度。

0 人收藏 0 人点赞
#multimodal

@lillian_ma_: 我们在我最爱的博物馆举办了湾区最大的夏季多模态活动,总是感觉特别……

X AI KOLs Following ↗ · 2026-09-18 缓存

Lillian Ma 在湾区的一家博物馆举办了一场大型多模态活动,展示了 Inference、MCP 和 AgentBox 等产品,有超过200名来自合作伙伴公司的参与者。

0 人收藏 0 人点赞
#multimodal

在Token空间中解读情感:SpeechLLMs的情感识别判别式适配

arXiv cs.CL ↗ · 2026-09-18 缓存

本文提出了针对SpeechLLMs的情感识别判别式适配方法,通过在线性分类头上使用最终提示词token的隐状态,提升性能和可解释性,消除幻觉并增强情感方向分析。

0 人收藏 0 人点赞
#multimodal

Qwen3.8-Omni-Flash:全感官体验。智能交付(阅读时间18分钟)

TLDR AI ↗ · 2026-09-18

Qwen3.8-Omni-Flash是一款全模态AI模型,拥有百万token上下文窗口,支持文本、图像、音频和视频输入,性能与Gemini 3.8 Flash相当或更优,现已在Qianwen AI平台上线。

0 人收藏 0 人点赞
#multimodal

Alibaba 发布 Qwen 3.8 Omni Flash

Hacker News Top ↗ · 2026-09-17

Alibaba 已发布 Qwen 3.8 Omni Flash AI 模型,该模型可能具备多模态能力,并针对速度进行了优化。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈