multimodal-ai

标签

Cards List
#multimodal-ai

SkinAgent AI:一种基于安全的多模态智能体框架,用于非诊断性护肤支持

arXiv cs.AI ↗ · 7小时前 缓存

本文介绍了SkinAgent AI,一个用于非诊断性护肤支持的多模态智能体框架,该框架结合了视觉分析与使用大型语言模型的安全、可审计的编排。

0 人收藏 0 人点赞
#multimodal-ai

@rohanpaul_ai: GLM-5.3 在一个由 @aimlapi 进行的5场景物理测试中击败了 Space Bunny Alpha(今天新推出的隐身模型),涉及牛顿摆。

X AI KOLs Following ↗ · 昨天 缓存

GLM-5.3 在 AI/ML API 进行的5场景物理测试中优于 Space Bunny Alpha,突显了AI物理模拟的优势和劣势。

0 人收藏 0 人点赞
#multimodal-ai

Summarize, Judge, Refine:用于多模态内容审核的解耦内容理解与策略学习

arXiv cs.CL ↗ · 3天前 缓存

本文提出了一种称为Summarize-Judge-Refine(SJR)的双模型架构,用于多模态内容审核。该架构通过自然语言摘要解耦内容理解与策略学习,实现了显著的性能提升和少样本策略适配。

0 人收藏 0 人点赞
#multimodal-ai

用于空中作战决策支持的离线多模态大型语言模型

arXiv cs.AI ↗ · 4天前 缓存

本文研究离线多模态大型语言模型作为空中作战的决策支持工具,详细描述了一种模块化检索增强架构,并介绍了与Brazilian Air Force合作的试点研究,该研究显示在条令评估任务中认知负荷降低且效率提高。

0 人收藏 0 人点赞
#multimodal-ai

先学习后判断:用于可解释仇恨模因检测的渐进式知识-决策对齐方法

arXiv cs.CL ↗ · 2026-09-18 缓存

本文提出了ProKDA,一种用于可解释仇恨模因检测的渐进式知识-决策对齐方法,通过解耦解释和检测任务实现了最先进的性能。

0 人收藏 0 人点赞
#multimodal-ai

少即是多:通过多信号晚期融合实现无图谱多模态RAG

arXiv cs.CL ↗ · 2026-09-18 缓存

TrioRAG是一个无图谱的多模态RAG框架,使用多信号晚期融合来实现高效的跨文档问答,性能匹配或超越基于图谱的系统。此外,它引入了AutoQA,一个基于网络图像的汽车基准测试。

0 人收藏 0 人点赞
#multimodal-ai

基于潜在叙事推理的高效多模态生成式推荐

arXiv cs.CL ↗ · 2026-09-16 缓存

本文提出了NarraLite,一个高效的多模态生成式推荐框架,它利用潜在叙事推理来改进剧集内容预测,以提高准确性和效率。

0 人收藏 0 人点赞
#multimodal-ai

SHIFT-M3:基于对齐一致性的多模态ECG记录完整性预融合筛查

arXiv cs.CL ↗ · 2026-09-15 缓存

SHIFT-M3是一种轻量级预融合筛查工具,用于衡量LLM生成和临床报告摘要之间ECG记录的对齐一致性,在检测数据完整性问题方面达到高准确性。

0 人收藏 0 人点赞
#multimodal-ai

Sierra的多模态智能体

Product Hunt ↗ · 2026-09-14 缓存

Sierra发布多模态AI智能体,可在语音、文本和视觉之间动态切换,以提升客户体验。

0 人收藏 0 人点赞
#multimodal-ai

@0xLogicrw: 马斯克又吹牛逼了,说 Grok 5 无人可敌。 大哥,只有你一家在不停地训下一代大模型吗?!

X AI KOLs Timeline ↗ · 2026-09-14 缓存

Elon Musk tweets that Grok 5 may be better than any existing AI model, comparing Grok versions to other models like Opus 5.0 and highlighting improvements in upcoming versions.

0 人收藏 0 人点赞
#multimodal-ai

并非所有提示都是平等的:探索引导的提示脚手架用于多模态强化后训练

Hugging Face Daily Papers ↗ · 2026-09-14 缓存

本文提出了一种探索引导的提示脚手架框架,该框架动态调整多模态强化学习的训练提示,在基准测试中实现了高达9.7%的相对性能提升。

0 人收藏 0 人点赞
#multimodal-ai

文本何时具有信息性?多模态时间序列预测的信息论度量基准测试

arXiv cs.AI ↗ · 2026-09-12 缓存

本文提出一个合成基准,旨在评估信息论度量在多模态时间序列预测中衡量文本标注信息性的能力,并证明其可用于无需模型训练的标注审核。

0 人收藏 0 人点赞
#multimodal-ai

一位来自比哈尔邦的20岁独立开发者如何打造一个开源全能AI模型(5.84B),在MATH-500基准测试中超越Apple的AFM 3B模型(74.2% vs 48.0%)

Reddit r/ArtificialInteligence ↗ · 2026-09-11

来自比哈尔邦的20岁独立开发者Abhinav Anand发布了Arcle V1,这是一个开源权重的5.84B参数统一全能AI模型,在包括MATH-500在内的多个基准测试中优于Apple的AFM 3B模型。

0 人收藏 0 人点赞
#multimodal-ai

SenseNova-U1.5: 迈向原生统一视觉智能

Hugging Face Daily Papers ↗ · 2026-09-10 缓存

SenseNova-U1.5是一个8B原生统一多模态模型,它通过补丁重建、精选数据和专家优化,在无需编码器或VAE的情况下执行视觉理解、推理和生成,实现高保真度和指令遵循。

0 人收藏 0 人点赞
#multimodal-ai

相比GPT-4o直接视觉处理,我将图像处理token使用量减少了约95%,同时保持了大致相同的准确度。这有多重要?[P]

Reddit r/MachineLearning ↗ · 2026-09-08

一位研究人员分享了初步结果,展示了一种方法,与GPT-4o相比,将图像处理token使用量减少约95%,同时保持了相似的准确度,并寻求关于其重要性的反馈。

0 人收藏 0 人点赞
#multimodal-ai

GUI代理是否知晓何时不应行动?实现多模态GUI代理的冲突感知终止

arXiv cs.AI ↗ · 2026-09-04 缓存

论文引入ConflictGUI,一个用于GUI代理冲突感知终止的基准,并提出ConflictGuard,一个推理时框架,旨在减少过度服从行为并提升在冲突指令下的性能。

0 人收藏 0 人点赞
#multimodal-ai

@songhan_mit: 惊人的创新与执行力。恭喜!

X AI KOLs Timeline ↗ · 2026-09-03 缓存

Nunchux AI 推出了 Modelverse,这是一个多模态生成式AI推理服务,通过单一API提供快速、实惠的访问,支持超过30种图像、视频和化身模型。

0 人收藏 0 人点赞
#multimodal-ai

@PyTorch:探索开源智能搜索和硬件引导工作流如何在GPU和TPU上实现显著加速

X AI KOLs Timeline ↗ · 2026-09-03 缓存

PyTorch北美大会将在圣何塞举行,设有智能搜索、硬件引导工作流和AI性能优化等专场,演讲者来自主要科技公司。

0 人收藏 0 人点赞
#multimodal-ai

PhoenixNent-Video:基于证据的多模态代理框架,用于自动化视频面试评估

arXiv cs.AI ↗ · 2026-09-03 缓存

PhoenixNent-Video 提出了一种基于证据的多模态代理框架,用于自动化视频面试评估,通过使用结构化视频图和强化学习,在基准测试中达到了91.50%的等级准确率。

0 人收藏 0 人点赞
#multimodal-ai

@MaxForAI: 天啊!这个AI课堂的案例研究简直太棒了!网友@internetphysics 使用 fal's H3 Max 创作…

X AI KOLs Timeline ↗ · 2026-09-02 缓存

一个案例研究展示了一个使用 fal's H3 Max 的 AI 课堂,它能够根据用户问题实时生成视频解释,将互动辅导与多模态内容创作相结合。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈