perception

标签

Cards List
#perception

两辆无人赛车在155英里时速下相撞。这或许是一件好事

Wired ↗ · 2天前 缓存

在Imola举行的A2RL赛季揭幕战中,两辆无人赛车在Unimore的激光雷达和雷达系统失效后以155英里时速相撞,凸显了自动驾驶车辆的计算能力与实时故障处理之间的差距——赛事组织者认为,这一事件对推进现实世界自动驾驶安全具有重要价值。

0 人收藏 0 人点赞
#perception

GAE:学习用于3D一致世界生成的几何原生潜空间

Hugging Face Daily Papers ↗ · 2026-09-21 缓存

本文介绍了GAE,一种几何原生的自动编码器,它创建了一个紧凑的潜空间,用于生成3D一致的场景,相比现有方法,提升了视觉质量和一致性。

0 人收藏 0 人点赞
#perception

@lateinteraction: 无论你如何看待实验室对清晰愉快写作的投入不足,而偏重数学和编程等技能,……

X AI KOLs Timeline ↗ · 2026-09-15

这篇帖子指出,AI实验室对清晰写作技能的投入不足,相比数学和编程,严重损害了它们的公众形象。

0 人收藏 0 人点赞
#perception

Necker, 1832: "观察几何立体图形时的光学现象"

Hacker News Top ↗ · 2026-09-12

这篇由内克于1832年发表的论文描述了一种光学现象:一幅几何立体图形的二维图示可以被感知为一个会改变朝向的三维立方体。

0 人收藏 0 人点赞
#perception

@thedarshakrana: 警告:这个卡尔·萨根的解释引发了存在危机。他解释了第五维生物如何感知三维……

X AI KOLs Timeline ↗ · 2026-09-03 缓存

文章解释了卡尔·萨根关于高维生物如何感知我们三维世界的类比,利用几何逻辑来阐述挑战人类对现实认知的概念。

0 人收藏 0 人点赞
#perception

@gabriel1: 我: *越来越迷失在抽象概念和对AI未来工作的兴奋中* 他们: "所以...它像是…

X AI KOLs Timeline ↗ · 2026-08-15 缓存

一条推文讨论了向非技术受众解释AI的挑战,并断言AI的采用尚未真正开始。

0 人收藏 0 人点赞
#perception

基于预训练Transformer的感知模型的对抗鲁棒溯因融合

arXiv cs.AI ↗ · 2026-08-06 缓存

本文提出了一种无需领域知识的元认知层,用于融合多个基于预训练ViT的感知模型,利用标签向量池和基于一致性的溯因。在干净数据上,它可与多数投票基线持平,并且对协同标签翻转攻击尤其鲁棒。

0 人收藏 0 人点赞
#perception

LVLMs 能否揭示视觉错觉背后的真相?感知与推理能力分析

arXiv cs.CL ↗ · 2026-07-31 缓存

本文介绍了 IllusionReasoning,一个使用真实世界视觉错觉的基准,用于联合评估大型视觉语言模型(LVLMs)的感知和推理能力,发现当前模型的推理能力并不像声称的那样先进。

0 人收藏 0 人点赞
#perception

宇航员描述六个月任务后持续的'observer'感觉

Hacker News Top ↗ · 2026-07-27 缓存

从六个月国际空间站任务返回的宇航员报告称,在着陆数周后仍存在持续的'observer sensation'——感觉与自己的生活脱节,仿佛从外部观看——这是神经系统适应微重力后产生的感知后遗症。

0 人收藏 0 人点赞
#perception

Seed IQ: 超越ARC AGI 3?看它如何在《毁灭战士II》中穿行。

Reddit r/ArtificialInteligence ↗ · 2026-07-27

Seed IQ通过在《毁灭战士II》中操控,展示了在动态环境中的高级实时感知、推理和适应能力,可能超越像ARC AGI 3这样的静态基准测试。

0 人收藏 0 人点赞
#perception

GPT-5.5 在 ActiveVision 上得分 10.6%,人类达到 96.1% [R]

Reddit r/MachineLearning ↗ · 2026-07-23

一篇新的 arXiv 论文引入了 ActiveVision 基准测试,旨在测试重复视觉感知能力,发现前沿视觉模型如 GPT-5.5 和 Claude Fable 5 分别仅得分 10.6% 和 3.5%,而人类达到了 96.1%。

0 人收藏 0 人点赞
#perception

Color Pass-Through:通过相机-显示器耦合

Hugging Face Daily Papers ↗ · 2026-07-14 缓存

一篇研究论文,提出了Color Pass-Through,这是一个端到端学习框架,将相机和显示器视为一个耦合系统,以提高屏幕上图像的颜色准确性,相较于基线取得了显著提升。

0 人收藏 0 人点赞
#perception

视频生成模型是通用视觉学习者

Hugging Face Daily Papers ↗ · 2026-07-10 缓存

本文提出,大规模文本到视频生成可作为计算机视觉的强大预训练范式,介绍了GenCeption,它在多种视觉任务上实现了最先进的性能,具有高数据效率和向未见领域的涌现泛化能力。

0 人收藏 0 人点赞
#perception

COMPASS:在统一多模态模型中锚定组合意图引导

arXiv cs.AI ↗ · 2026-06-30 缓存

本文提出了COMPASS,首个能够同时锚定组合意图控制,以进行组合感知和组合引导生成的统一多模态框架,并引入了共享专家令牌和Comp-11数据集。

0 人收藏 0 人点赞
#perception

从结构到协同:多模态大语言模型中视觉-语言感知范式演进的综述

arXiv cs.CL ↗ · 2026-06-26 缓存

本综述论文系统回顾了多模态大语言模型(MLLMs)中统一视觉-语言感知的范式演进,提出了五阶段分类法,并指出了通向通用多模态智能的开放挑战。

0 人收藏 0 人点赞
#perception

PerceptionRubrics: 校准多模态评估以契合人类感知

Hugging Face Daily Papers ↗ · 2026-06-26 缓存

PerceptionRubrics 引入了一种基于评分准则的多模态评估框架,通过原子审计和门控评分,使基准分数更好地与人类感知对齐,揭示了可靠性差距和开闭分层。

0 人收藏 0 人点赞
#perception

@heyshrutimishra:我分析了自主机器人背后的软件栈,以下是让它们真正工作的原因:它由50多个工具协同…

X AI KOLs Following ↗ · 2026-06-20 缓存

对自主机器人背后软件栈的分析,拆解了从感知到云支持的各个组件,并指出大多数工具都是开源的。

0 人收藏 0 人点赞
#perception

先见后思:解耦感知与推理实现抗捷径的多模态在策略自蒸馏

Hugging Face Daily Papers ↗ · 2026-06-17 缓存

本文介绍了ViGOS,一种多模态在策略自蒸馏方法,通过让学生模型先产生视觉描述再进行推理来解耦感知与推理,减少对捷径的依赖并改善图像接地行为。

0 人收藏 0 人点赞
#perception

迈向下一代医疗:医学具身AI在感知、决策与行动方面的综述

arXiv cs.AI ↗ · 2026-06-16 缓存

本文系统地综述了医学具身AI的核心组成部分,强调了在临床环境中感知、决策与行动的协同整合,并回顾了代表性应用、数据集及未来研究方向。

0 人收藏 0 人点赞
#perception

超越API:探究MLLMs在物理工具使用中的极限

arXiv cs.CL ↗ · 2026-06-10 缓存

本文介绍了PhysTool-Bench,一个用于评估多模态大语言模型在真实世界场景中识别和规划物理工具使用能力的基准。作者发现,即使是最佳模型也只能识别58.7%的工具,并仅完成21.0%的端到端查询,揭示了感知和功能常识两个层面的缺陷。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈