标签
介绍Ternary Bonsai 2 27B,这是一个高度压缩的AI模型,在占用空间缩小9倍的同时保留了98.2%的性能,使得推理、编码和多模态处理等任务能够高效地在本地部署。
WeVisDoc是一款基于Qwen3-VL模型微调的端到端文档解析器,可将页面图像转换为包含LaTeX公式和HTML表格的结构化Markdown,在OmniDocBench v1.6等基准测试中实现了顶级性能。
本文介绍了Re2A,一个用于情境化对话推荐的框架,该框架使用基于评分标准的偏好推理和基于偏好的对齐来增强用户偏好满意度和情境一致性。
本文提出了一种多模态生成框架,将细调的Stable Diffusion XL与LLaMA相结合,用于可控且文化忠实的Ulos图案生成,并通过消融研究和定性评估进行验证。
NeMo Data Designer (NDD) 是一个开源、可扩展的多模态合成数据生成框架,专为人工智能模型开发中的直观使用和可重现性而设计。
本文介绍了Mult2EMo数据集,用于研究多模态社交媒体帖子中的情感表达与感知,发现重构情感表达具有挑战性,尤其是当帖子严重依赖图像时。
介绍了DeepSeek-V4.1-Flash,一个多模态混合专家(MoE)模型,拥有552B参数,采用先进的KV缓存压缩技术,以降低部署成本并提升长上下文代理工作负载的效率。
一个新的隐秘AI模型Union Alpha已在OpenRouter和OpenCode上免费发布,具有256K上下文的多模态能力,并声称具有前沿级别的通用性能,引发了关于其来源的猜测。
豆包大模型2.1 Pro发布0915版本更新,重点改进了Agent任务交付、多模态写代码、多模态理解和推理成本。
本文提出了一种用于机械系统故障检测的多模态异常检测框架,该框架采用自监督跨模态重构和自适应阈值设置,以提高在分布偏移下的鲁棒性。
本文研究人类对话中口语否定线索如何在多模态非言语行为中体现,使用时间序列分类模型在无词汇或声学输入的情况下区分否定上下文与控制上下文。
GraMRAG是一个新的多智能体RAG框架,它使用图记忆和强化学习来提升复杂多模态任务中的推理深度和记忆结构,实现了最先进的性能。
苹果的 iOS 27 更新使用 Google 的 Gemini 模型显著提升了 Siri,支持复杂请求和屏幕上下文理解。
这篇文章强调了处理复杂真实文档的困难,并推荐LlamaParse作为一款使用多个AI代理进行高效、可扩展和多模态文档解析的工具。
Intern-S2-397B 是一款大型多模态AI模型,具备推理、编程和科学智能体任务的能力,现已在 Hugging Face 上可用,并得到 vLLM 的首日支持。
本文研究检索信号在自适应多模态RAG系统中是否提供超越查询的额外路由价值,得出结论:它们并不能一致地改善决策。
FINESSE是一个基于代理的模拟框架和基准数据集,用于生成合成的多模态金融事件序列,解决数据稀缺问题,并支持欺诈检测和余额预测等任务。
本文评估了利用移动设备上的多模态数据进行隐私保护压力预测的设备端语言模型,发现轻量级模型实现了低延迟和可预测的资源使用,同时指出了移动心理健康应用的实际限制。
LynnReal-Omni 是一个统一的多模态视频扩散框架,它将智能体视觉控制与高保真生成和实时加速相结合,以实现稳定、可控的视频创作。