标签
文章解释了卡尔·萨根关于高维生物如何感知我们三维世界的类比,利用几何逻辑来阐述挑战人类对现实认知的概念。
一条推文讨论了向非技术受众解释AI的挑战,并断言AI的采用尚未真正开始。
本文提出了一种无需领域知识的元认知层,用于融合多个基于预训练ViT的感知模型,利用标签向量池和基于一致性的溯因。在干净数据上,它可与多数投票基线持平,并且对协同标签翻转攻击尤其鲁棒。
本文介绍了 IllusionReasoning,一个使用真实世界视觉错觉的基准,用于联合评估大型视觉语言模型(LVLMs)的感知和推理能力,发现当前模型的推理能力并不像声称的那样先进。
从六个月国际空间站任务返回的宇航员报告称,在着陆数周后仍存在持续的'observer sensation'——感觉与自己的生活脱节,仿佛从外部观看——这是神经系统适应微重力后产生的感知后遗症。
Seed IQ通过在《毁灭战士II》中操控,展示了在动态环境中的高级实时感知、推理和适应能力,可能超越像ARC AGI 3这样的静态基准测试。
一篇新的 arXiv 论文引入了 ActiveVision 基准测试,旨在测试重复视觉感知能力,发现前沿视觉模型如 GPT-5.5 和 Claude Fable 5 分别仅得分 10.6% 和 3.5%,而人类达到了 96.1%。
一篇研究论文,提出了Color Pass-Through,这是一个端到端学习框架,将相机和显示器视为一个耦合系统,以提高屏幕上图像的颜色准确性,相较于基线取得了显著提升。
本文提出,大规模文本到视频生成可作为计算机视觉的强大预训练范式,介绍了GenCeption,它在多种视觉任务上实现了最先进的性能,具有高数据效率和向未见领域的涌现泛化能力。
本文提出了COMPASS,首个能够同时锚定组合意图控制,以进行组合感知和组合引导生成的统一多模态框架,并引入了共享专家令牌和Comp-11数据集。
本综述论文系统回顾了多模态大语言模型(MLLMs)中统一视觉-语言感知的范式演进,提出了五阶段分类法,并指出了通向通用多模态智能的开放挑战。
PerceptionRubrics 引入了一种基于评分准则的多模态评估框架,通过原子审计和门控评分,使基准分数更好地与人类感知对齐,揭示了可靠性差距和开闭分层。
对自主机器人背后软件栈的分析,拆解了从感知到云支持的各个组件,并指出大多数工具都是开源的。
本文介绍了ViGOS,一种多模态在策略自蒸馏方法,通过让学生模型先产生视觉描述再进行推理来解耦感知与推理,减少对捷径的依赖并改善图像接地行为。
本文系统地综述了医学具身AI的核心组成部分,强调了在临床环境中感知、决策与行动的协同整合,并回顾了代表性应用、数据集及未来研究方向。
本文介绍了PhysTool-Bench,一个用于评估多模态大语言模型在真实世界场景中识别和规划物理工具使用能力的基准。作者发现,即使是最佳模型也只能识别58.7%的工具,并仅完成21.0%的端到端查询,揭示了感知和功能常识两个层面的缺陷。
本文探讨了人们将任何明显经过修改的图像或视频标记为“AI生成”的趋势,并质疑这个术语是否正在成为早于AI的数字处理的通用标签。
MemDreamer 通过分层图记忆和代理检索解耦长视频理解中的感知与推理,在降低计算开销的同时实现了最先进的性能。
一篇综述,以人类视角呈现对多模态大语言模型(MLLMs)进行视频理解的研究,围绕观看、记忆和推理能力组织,涵盖挑战、方法和应用。
一条推文讨论了OpenAI的发布已不再被视为创业公司的终结者,并提到了一个使用Cloudflare的Sites、D1和R2部署网站的新Codex功能。