perception

标签

Cards List
#perception

@thedarshakrana: 警告:这个卡尔·萨根的解释引发了存在危机。他解释了第五维生物如何感知三维……

X AI KOLs Timeline · 6天前 缓存

文章解释了卡尔·萨根关于高维生物如何感知我们三维世界的类比,利用几何逻辑来阐述挑战人类对现实认知的概念。

0 人收藏 0 人点赞
#perception

@gabriel1: 我: *越来越迷失在抽象概念和对AI未来工作的兴奋中* 他们: "所以...它像是…

X AI KOLs Timeline · 2026-08-15 缓存

一条推文讨论了向非技术受众解释AI的挑战,并断言AI的采用尚未真正开始。

0 人收藏 0 人点赞
#perception

基于预训练Transformer的感知模型的对抗鲁棒溯因融合

arXiv cs.AI · 2026-08-06 缓存

本文提出了一种无需领域知识的元认知层,用于融合多个基于预训练ViT的感知模型,利用标签向量池和基于一致性的溯因。在干净数据上,它可与多数投票基线持平,并且对协同标签翻转攻击尤其鲁棒。

0 人收藏 0 人点赞
#perception

LVLMs 能否揭示视觉错觉背后的真相?感知与推理能力分析

arXiv cs.CL · 2026-07-31 缓存

本文介绍了 IllusionReasoning,一个使用真实世界视觉错觉的基准,用于联合评估大型视觉语言模型(LVLMs)的感知和推理能力,发现当前模型的推理能力并不像声称的那样先进。

0 人收藏 0 人点赞
#perception

宇航员描述六个月任务后持续的'observer'感觉

Hacker News Top · 2026-07-27 缓存

从六个月国际空间站任务返回的宇航员报告称,在着陆数周后仍存在持续的'observer sensation'——感觉与自己的生活脱节,仿佛从外部观看——这是神经系统适应微重力后产生的感知后遗症。

0 人收藏 0 人点赞
#perception

Seed IQ: 超越ARC AGI 3?看它如何在《毁灭战士II》中穿行。

Reddit r/ArtificialInteligence · 2026-07-27

Seed IQ通过在《毁灭战士II》中操控,展示了在动态环境中的高级实时感知、推理和适应能力,可能超越像ARC AGI 3这样的静态基准测试。

0 人收藏 0 人点赞
#perception

GPT-5.5 在 ActiveVision 上得分 10.6%,人类达到 96.1% [R]

Reddit r/MachineLearning · 2026-07-23

一篇新的 arXiv 论文引入了 ActiveVision 基准测试,旨在测试重复视觉感知能力,发现前沿视觉模型如 GPT-5.5 和 Claude Fable 5 分别仅得分 10.6% 和 3.5%,而人类达到了 96.1%。

0 人收藏 0 人点赞
#perception

Color Pass-Through:通过相机-显示器耦合

Hugging Face Daily Papers · 2026-07-14 缓存

一篇研究论文,提出了Color Pass-Through,这是一个端到端学习框架,将相机和显示器视为一个耦合系统,以提高屏幕上图像的颜色准确性,相较于基线取得了显著提升。

0 人收藏 0 人点赞
#perception

视频生成模型是通用视觉学习者

Hugging Face Daily Papers · 2026-07-10 缓存

本文提出,大规模文本到视频生成可作为计算机视觉的强大预训练范式,介绍了GenCeption,它在多种视觉任务上实现了最先进的性能,具有高数据效率和向未见领域的涌现泛化能力。

0 人收藏 0 人点赞
#perception

COMPASS:在统一多模态模型中锚定组合意图引导

arXiv cs.AI · 2026-06-30 缓存

本文提出了COMPASS,首个能够同时锚定组合意图控制,以进行组合感知和组合引导生成的统一多模态框架,并引入了共享专家令牌和Comp-11数据集。

0 人收藏 0 人点赞
#perception

从结构到协同:多模态大语言模型中视觉-语言感知范式演进的综述

arXiv cs.CL · 2026-06-26 缓存

本综述论文系统回顾了多模态大语言模型(MLLMs)中统一视觉-语言感知的范式演进,提出了五阶段分类法,并指出了通向通用多模态智能的开放挑战。

0 人收藏 0 人点赞
#perception

PerceptionRubrics: 校准多模态评估以契合人类感知

Hugging Face Daily Papers · 2026-06-26 缓存

PerceptionRubrics 引入了一种基于评分准则的多模态评估框架,通过原子审计和门控评分,使基准分数更好地与人类感知对齐,揭示了可靠性差距和开闭分层。

0 人收藏 0 人点赞
#perception

@heyshrutimishra:我分析了自主机器人背后的软件栈,以下是让它们真正工作的原因:它由50多个工具协同…

X AI KOLs Following · 2026-06-20 缓存

对自主机器人背后软件栈的分析,拆解了从感知到云支持的各个组件,并指出大多数工具都是开源的。

0 人收藏 0 人点赞
#perception

先见后思:解耦感知与推理实现抗捷径的多模态在策略自蒸馏

Hugging Face Daily Papers · 2026-06-17 缓存

本文介绍了ViGOS,一种多模态在策略自蒸馏方法,通过让学生模型先产生视觉描述再进行推理来解耦感知与推理,减少对捷径的依赖并改善图像接地行为。

0 人收藏 0 人点赞
#perception

迈向下一代医疗:医学具身AI在感知、决策与行动方面的综述

arXiv cs.AI · 2026-06-16 缓存

本文系统地综述了医学具身AI的核心组成部分,强调了在临床环境中感知、决策与行动的协同整合,并回顾了代表性应用、数据集及未来研究方向。

0 人收藏 0 人点赞
#perception

超越API:探究MLLMs在物理工具使用中的极限

arXiv cs.CL · 2026-06-10 缓存

本文介绍了PhysTool-Bench,一个用于评估多模态大语言模型在真实世界场景中识别和规划物理工具使用能力的基准。作者发现,即使是最佳模型也只能识别58.7%的工具,并仅完成21.0%的端到端查询,揭示了感知和功能常识两个层面的缺陷。

0 人收藏 0 人点赞
#perception

AI是否正在成为任何数字创作或修改内容的通用术语?

Reddit r/ArtificialInteligence · 2026-06-09

本文探讨了人们将任何明显经过修改的图像或视频标记为“AI生成”的趋势,并质疑这个术语是否正在成为早于AI的数字处理的通用标签。

0 人收藏 0 人点赞
#perception

MemDreamer:通过分层图记忆与代理检索机制解耦长视频理解中的感知与推理

Hugging Face Daily Papers · 2026-06-05 缓存

MemDreamer 通过分层图记忆和代理检索解耦长视频理解中的感知与推理,在降低计算开销的同时实现了最先进的性能。

0 人收藏 0 人点赞
#perception

观看、记忆、推理:基于MLLMs的人类视角视频理解

Hugging Face Daily Papers · 2026-06-05 缓存

一篇综述,以人类视角呈现对多模态大语言模型(MLLMs)进行视频理解的研究,围绕观看、记忆和推理能力组织,涵盖挑战、方法和应用。

0 人收藏 0 人点赞
#perception

@benhylak: 曾几何时,OpenAI 的发布被视为创业公司的终结者。每家公司都会胆战心惊。现在…

X AI KOLs Following · 2026-06-02 缓存

一条推文讨论了OpenAI的发布已不再被视为创业公司的终结者,并提到了一个使用Cloudflare的Sites、D1和R2部署网站的新Codex功能。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈