multimodal

标签

Cards List
#multimodal

internlm/Intern-Decision 4B 和 0.8B

Reddit r/LocalLLaMA ↗ · 59分钟前 缓存

Intern-Decision 4B 和 0.8B 是从 Qwen3.5-4B 微调而来的多模态结构化决策模型,旨在单次前向传播中返回多个问题的答案分布,并具有强大的基准性能。

0 人收藏 0 人点赞
#multimodal

ArGuard 共享任务:阿拉伯语模因与 LLM 提示中的有害内容检测

arXiv cs.CL ↗ · 昨天 缓存

ArGuard 是一个专注于检测阿拉伯语模因与 LLM 提示中有害内容的共享任务,突出了细粒度分类中的挑战,并发布数据集以供进一步研究。

0 人收藏 0 人点赞
#multimodal

Gemini 3.8 Live 搭配 Live Avatar(1分钟阅读)

TLDR AI ↗ · 昨天 缓存

Gemini 3.8 Live 搭配 Live Avatar 为对话式AI带来了实时视觉呈现,允许企业通过动态化身和多语言支持创建更自然、交互性更强的数字体验。

0 人收藏 0 人点赞
#multimodal

@_philschmid: Gemini 3.8 Flash. 直接使用Gemini进行多模态理解。

X AI KOLs Following ↗ · 昨天 缓存

一条推文建议使用Gemini 3.8 Flash进行多模态理解,并引用了一个视觉测试,该测试比较了AI模型从绘画中识别人物的能力。

0 人收藏 0 人点赞
#multimodal

Flux 3 Action: 开放权重 7B 世界动作模型

Reddit r/singularity ↗ · 2天前

FLUX 3 Action 是一款开放权重的 7B AI 模型,在 RoboLab 基准测试中树立了新标准,其性能超越了之前的开源模型,同时速度更快、效率更高,适用于机器人技术以及其他需要视觉动作规划的环境。

0 人收藏 0 人点赞
#multimodal

Space Bunny 是 OpenCode 中的新秘密模型。免费试用,多模态

Reddit r/LocalLLaMA ↗ · 2天前

名为 Space Bunny 的秘密多模态 AI 模型已在 OpenCode 中发布,可免费试用,发布公司未知

0 人收藏 0 人点赞
#multimodal

@heyshrutimishra:小米的 MiMo V2.6 Pro 现在是 Artificial Analysis 上全球排名第一的开源模型。同时也是中国开发的模型中排名第一的…

X AI KOLs Timeline ↗ · 2天前 缓存

小米的 MiMo V2.6 Pro 现在是 Artificial Analysis 上全球排名第一的开源 AI 模型,在智能指数上几乎与 GPT-5.6 Sol 持平,同时为实际应用提供了成本效益高的定价。

0 人收藏 0 人点赞
#multimodal

@yibie: https://x.com/yibie/status/2102565806466912408

X AI KOLs Timeline ↗ · 3天前 缓存

Jev-Omni 是第一个将类型化决策扩展到多模态的开放权重模型,支持文本、图像、音频和视频,直接返回选项的概率分布而不生成解释。

0 人收藏 0 人点赞
#multimodal

@omarsar0: 令人印象深刻的论文,展示了工具对编码智能体结果的影响有多大。工具确实在智能体所获得的内容中扮演了重要角色……

X AI KOLs Following ↗ · 3天前 缓存

本文介绍了ReFigBench,这是一个用于评估编码智能体将科学图表重建为可编辑PowerPoint幻灯片的基准测试,表明工具对不同模型家族的性能有显著影响。

0 人收藏 0 人点赞
#multimodal

@yifanzhang_: 非常有趣的模型架构,使用了块稀疏注意力机制。 https://pixverse.ai/en/blog/pixverse-r2-scaling-r…

X AI KOLs Timeline ↗ · 3天前 缓存

PixVerse R2 引入了一种统一的缩放架构,用于实时视听世界模型,利用块稀疏注意力机制和持续预训练来增强视频生成和交互控制。

0 人收藏 0 人点赞
#multimodal

@AdinaYakup: RedNote 发布不频繁,但每个都很扎实 https://huggingface.co/dots-studio/dots3-note-prev…

X AI KOLs Timeline ↗ · 4天前 缓存

dots3-note Preview 是一个多模态 Mixture-of-Experts AI模型,具有280B总参数和16B激活参数,支持多达512K token上下文,在Hugging Face上作为开源权重模型发布。

0 人收藏 0 人点赞
#multimodal

Xiaomi开源MiMo-V2.6 Pro和Flash模型(2分钟阅读)

TLDR AI ↗ · 4天前 缓存

Xiaomi已开源MiMo-V2.6系列,推出两款全模态AI模型Pro和Flash,性能可与顶级专有模型媲美,并适用于各种应用。

0 人收藏 0 人点赞
#multimodal

XiaomiMiMo/MiMo-V2.6-Flash-RL · Hugging Face

Reddit r/LocalLLaMA ↗ · 4天前 缓存

MiMo-V2.6-Flash-RL 是一个多模态AI模型,通过扩展强化学习实现自我改进,采用稀疏混合专家架构,总参数3090亿,上下文长度为100万令牌。

0 人收藏 0 人点赞
#multimodal

在寄存器上驾驶,在风险上推理:面向基于寄存器的端到端自动驾驶的风险感知占用表示

arXiv cs.AI ↗ · 5天前 缓存

本文提出RRDrive,一种用于基于寄存器的端到端自动驾驶的风险感知占用表示,该表示在复杂场景中改进了轨迹预测和选择,取得了显著的性能提升。

0 人收藏 0 人点赞
#multimodal

Omni Demand Understanding: 多模态交互中上下文用户意图推理的基准测试

arXiv cs.CL ↗ · 5天前 缓存

本文介绍了Omni Demand Understanding (ODU),一个评估多模态AI模型如何从复杂音视频交互中推断用户需求的基准测试,揭示了当前模型中显著的性能差距。

0 人收藏 0 人点赞
#multimodal

VISPATH:面向多模态知识图谱问答的视觉意图引导路径推理

arXiv cs.CL ↗ · 5天前 缓存

VisPath 引入了一种视觉意图引导的路径推理框架,用于多模态知识图谱问答,在新的基准 VisPath-Bench 和现有数据集上取得了显著改进,超越了基线方法。

0 人收藏 0 人点赞
#multimodal

VideoGen-Agent:增强视频生成智能体

Hugging Face Daily Papers ↗ · 5天前 缓存

本文提出了VideoGen-Agent,一种基于强化学习的多模态智能体,它协调工具进行视频生成,在新的VABench基准测试上显著提升了性能。

0 人收藏 0 人点赞
#multimodal

akhilaaa3/Jev-Omni

Hugging Face Models Trending ↗ · 5天前 缓存

Jev-Omni 是一个基于 Gemma 4 12B IT 构建的多模态决策分类器,经过微调以处理文本、图像、音频和视频,根据问题为选项提供概率分数。

0 人收藏 0 人点赞
#multimodal

@HuggingModels: OCR刚刚经历了一次重大升级。jina-ocr-v1是一款专为文档智能设计的多模态视觉语言模型。它 rea…

X AI KOLs Timeline ↗ · 2026-09-18 缓存

Jina-ocr-v1是一款专为高级文档智能设计的多模态视觉语言模型,能够从多语言图像中读取文本。

0 人收藏 0 人点赞
#multimodal

@Saccc_c: 说实话,实际上,大多数人在大部分工作中并不真正需要Astra。我一直在使用ds v4.1 fla…

X AI KOLs Following ↗ · 2026-09-18 缓存

一位用户分享了从Astra切换到ds v4.1 flash的积极体验,强调了其多模态能力和快速速度。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈