multimodal

标签

Cards List
#multimodal

Bonsai 2 27B:在占用空间缩小9倍的条件下实现近无损压缩

Hacker News Top ↗ · 2026-09-17 缓存

介绍Ternary Bonsai 2 27B,这是一个高度压缩的AI模型,在占用空间缩小9倍的同时保留了98.2%的性能,使得推理、编码和多模态处理等任务能够高效地在本地部署。

0 人收藏 0 人点赞
#multimodal

腾讯WeVisDoc

Reddit r/LocalLLaMA ↗ · 2026-09-17

WeVisDoc是一款基于Qwen3-VL模型微调的端到端文档解析器,可将页面图像转换为包含LaTeX公式和HTML表格的结构化Markdown,在OmniDocBench v1.6等基准测试中实现了顶级性能。

0 人收藏 0 人点赞
#multimodal

Re2A:基于评分标准的偏好推理与对齐的情境化对话推荐

arXiv cs.AI ↗ · 2026-09-17 缓存

本文介绍了Re2A,一个用于情境化对话推荐的框架,该框架使用基于评分标准的偏好推理和基于偏好的对齐来增强用户偏好满意度和情境一致性。

0 人收藏 0 人点赞
#multimodal

细调稳定扩散XL的多模态条件控制,用于可控且文化忠实的Ulos图案生成

arXiv cs.AI ↗ · 2026-09-17 缓存

本文提出了一种多模态生成框架,将细调的Stable Diffusion XL与LLaMA相结合,用于可控且文化忠实的Ulos图案生成,并通过消融研究和定性评估进行验证。

0 人收藏 0 人点赞
#multimodal

NeMo Data Designer:一个多模态合成数据生成的可扩展框架

arXiv cs.AI ↗ · 2026-09-17 缓存

NeMo Data Designer (NDD) 是一个开源、可扩展的多模态合成数据生成框架,专为人工智能模型开发中的直观使用和可重现性而设计。

0 人收藏 0 人点赞
#multimodal

情感体验、表达与感知:多模态社交媒体帖子的情感分析

arXiv cs.CL ↗ · 2026-09-17 缓存

本文介绍了Mult2EMo数据集,用于研究多模态社交媒体帖子中的情感表达与感知,发现重构情感表达具有挑战性,尤其是当帖子严重依赖图像时。

0 人收藏 0 人点赞
#multimodal

TabPFN-3.5:技术报告

arXiv cs.LG ↗ · 2026-09-17 缓存

TabPFN-3.5 是一种新型表格基础模型,在多个基准测试中创下最佳性能,并在推理速度和多模态能力上进行了改进。

0 人收藏 0 人点赞
#multimodal

DeepSeek-V4.1-Flash:推动KV缓存压缩的极限

Hugging Face Daily Papers ↗ · 2026-09-17 缓存

介绍了DeepSeek-V4.1-Flash,一个多模态混合专家(MoE)模型,拥有552B参数,采用先进的KV缓存压缩技术,以降低部署成本并提升长上下文代理工作负载的效率。

0 人收藏 0 人点赞
#multimodal

新的隐蔽模型:Union Alpha

Reddit r/singularity ↗ · 2026-09-16

一个新的隐秘AI模型Union Alpha已在OpenRouter和OpenCode上免费发布,具有256K上下文的多模态能力,并声称具有前沿级别的通用性能,引发了关于其来源的猜测。

0 人收藏 0 人点赞
#multimodal

@seclink: Doubao is seriously badass this time, leaving other domestic large models in the dust by a huge margin.

X AI KOLs Following ↗ · 2026-09-16 缓存

豆包大模型2.1 Pro发布0915版本更新,重点改进了Agent任务交付、多模态写代码、多模态理解和推理成本。

0 人收藏 0 人点赞
#multimodal

通过自监督跨模态重构实现机械多模态时间序列的鲁棒故障检测

arXiv cs.LG ↗ · 2026-09-16 缓存

本文提出了一种用于机械系统故障检测的多模态异常检测框架,该框架采用自监督跨模态重构和自适应阈值设置,以提高在分布偏移下的鲁棒性。

0 人收藏 0 人点赞
#multimodal

超越言语通道的否定:对话中的时间多模态关联

arXiv cs.CL ↗ · 2026-09-16 缓存

本文研究人类对话中口语否定线索如何在多模态非言语行为中体现,使用时间序列分类模型在无词汇或声学输入的情况下区分否定上下文与控制上下文。

0 人收藏 0 人点赞
#multimodal

GraMRAG: 利用图记忆与强化学习协调多智能体多步推理

arXiv cs.CL ↗ · 2026-09-15 缓存

GraMRAG是一个新的多智能体RAG框架,它使用图记忆和强化学习来提升复杂多模态任务中的推理深度和记忆结构,实现了最先进的性能。

0 人收藏 0 人点赞
#multimodal

iOS 27 让我重新开始使用 Siri

TechCrunch AI ↗ · 2026-09-14 缓存

苹果的 iOS 27 更新使用 Google 的 Gemini 模型显著提升了 Siri,支持复杂请求和屏幕上下文理解。

0 人收藏 0 人点赞
#multimodal

@svpino:构建一个能处理真实文档的代理仍然极其困难。你们都在谈论通用人工智能(AGI),而这才是实际的问题所在。

X AI KOLs Timeline ↗ · 2026-09-14 缓存

这篇文章强调了处理复杂真实文档的困难,并推荐LlamaParse作为一款使用多个AI代理进行高效、可扩展和多模态文档解析的工具。

0 人收藏 0 人点赞
#multimodal

Intern-S2-397B(多模态、推理、编程与科学智能体能力)

Reddit r/LocalLLaMA ↗ · 2026-09-14

Intern-S2-397B 是一款大型多模态AI模型,具备推理、编程和科学智能体任务的能力,现已在 Hugging Face 上可用,并得到 vLLM 的首日支持。

0 人收藏 0 人点赞
#multimodal

超越查询:检索信号是否改善自适应多模态RAG路由?

arXiv cs.LG ↗ · 2026-09-14 缓存

本文研究检索信号在自适应多模态RAG系统中是否提供超越查询的额外路由价值,得出结论:它们并不能一致地改善决策。

0 人收藏 0 人点赞
#multimodal

FINESSE: 一个用于多模态金融事件序列的基于代理的模拟器和基准数据集

arXiv cs.LG ↗ · 2026-09-14 缓存

FINESSE是一个基于代理的模拟框架和基准数据集,用于生成合成的多模态金融事件序列,解决数据稀缺问题,并支持欺诈检测和余额预测等任务。

0 人收藏 0 人点赞
#multimodal

设备端语言模型在隐私保护压力预测中的应用:移动健康的多模态评估

arXiv cs.LG ↗ · 2026-09-14 缓存

本文评估了利用移动设备上的多模态数据进行隐私保护压力预测的设备端语言模型,发现轻量级模型实现了低延迟和可预测的资源使用,同时指出了移动心理健康应用的实际限制。

0 人收藏 0 人点赞
#multimodal

LynnReal-Omni:面向智能体视觉工作流的原生多模态视频生成

Hugging Face Daily Papers ↗ · 2026-09-14 缓存

LynnReal-Omni 是一个统一的多模态视频扩散框架,它将智能体视觉控制与高保真生成和实时加速相结合,以实现稳定、可控的视频创作。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈