computer-vision

标签

Cards List
#computer-vision

视频模型日益强大

Reddit r/singularity ↗ · 21小时前

本文讨论了AI视频模型日益增强的能力和改进,强调了它们在生成或处理视频内容方面的效果日益显著。

0 人收藏 0 人点赞
#computer-vision

@airesearch12: 介绍 ImageJevBench Jev-Omni decider-2b-vision Reflex 4B 视频展示了 89 张公开的合成图像。运行中 …

X AI KOLs Timeline ↗ · 昨天 缓存

ImageJevBench v0.1 被介绍为一个用于评估 AI 模型在图像决策任务上的基准,基于性能、成本和校准指标对系统如 Jev-Omni 和 decider-2b-vision 进行排名。

0 人收藏 0 人点赞
#computer-vision

@AdinaYakup: Gen-HumanEgo 来自 @GenrobotAI 的新机器人学习数据集 - 超过1,800小时的自我中心人类数据 - 超过10,000个独特任务…

X AI KOLs Timeline ↗ · 2天前 缓存

Gen-HumanEgo 是 GenrobotAI 发布的新机器人学习数据集,包含超过1,800小时的自我中心人类数据、超过10,000个独特任务以及同步的相机视图,包括3D手部关键点和结构化注释。

0 人收藏 0 人点赞
#computer-vision

@LinusEkenstam: 这太疯狂了

X AI KOLs Timeline ↗ · 2天前 缓存

AI在表情识别、目标检测和手指计数方面的能力实现了低于1秒的延迟,突出了显著的实时性能提升。

0 人收藏 0 人点赞
#computer-vision

使用视觉人工智能研究城市的承诺与风险

MIT News — Artificial Intelligence ↗ · 2天前 缓存

MIT Senseable City Lab的研究人员在一本新书中讨论了使用视觉AI分析城市环境的方法,强调了其在城市规划中的潜力,同时探讨了隐私和公平性方面的担忧。

0 人收藏 0 人点赞
#computer-vision

RGBD20K:一个用于RGB-D语义分割的大规模基准

Hugging Face Daily Papers ↗ · 2天前 缓存

本文介绍了RGBD20K,这是一个用于RGB-D语义分割的大规模基准数据集,包含160个细粒度类别和20,000对图像,具有高质量注释和一种新颖的分数净化融合方法。

0 人收藏 0 人点赞
#computer-vision

@paul_cal: 这些能力令人难以置信。这虽然不完美,但要达成这样的原型,以前可能需要多位有才华的人工作数周…

X AI KOLs Timeline ↗ · 3天前 缓存

Ryan Sael 展示了 Opus 5.5 能够在不到两小时内以低成本创建一个用于相机对焦教育的交互式镜头实验室,突显了先进的AI原型设计能力。

0 人收藏 0 人点赞
#computer-vision

@yoheinakajima: 在本地将对象检测延迟降低到0.35秒以下

X AI KOLs Timeline ↗ · 3天前 缓存

一位开发者分享了在本地硬件上将对象检测延迟降低到0.35秒以下的成就,突显了人工智能性能优化的进展。

0 人收藏 0 人点赞
#computer-vision

SCoR:一种用于预测科学概念之间关系的层次框架

arXiv cs.CL ↗ · 4天前 缓存

本文介绍了SCoR,一种用于预测科学概念之间关系的层次框架,其中包含一个基准和模型,通过预测类型化关系来改进研究方向的发现。

0 人收藏 0 人点赞
#computer-vision

ImIR: 基于图像指令调优的一体化图像修复

Hugging Face Daily Papers ↗ · 5天前 缓存

ImIR 通过使用源自图像的指令,适配预训练图像编辑模型以执行六种图像修复任务,实现高效且任务无关的修复。

0 人收藏 0 人点赞
#computer-vision

一体化多语言场景文本识别:基于脚本感知的混合专家模型

Hugging Face Daily Papers ↗ · 5天前 缓存

本文介绍了ScriptMoE,一种用于一体化多语言场景文本识别的脚本感知混合专家架构,以及TextMuSS-10M合成数据集,在基准测试中取得了最先进的准确率。

0 人收藏 0 人点赞
#computer-vision

三维场景交互理解的几何与语义耦合

Hugging Face Daily Papers ↗ · 5天前 缓存

本文介绍了Segment-Snap,一种结合几何与语义线索的方法,以提升三维场景中的交互理解,在运动门控AP和手柄检测指标上取得了显著提升。

0 人收藏 0 人点赞
#computer-vision

Segment Anything Model (SAM) 3.1(2分钟阅读)

TLDR AI ↗ · 5天前

SAM 3.1可以使用Meta Model API上的文本提示来检测、分割和跟踪图像和视频中的对象,并具有指定的推理费用。

0 人收藏 0 人点赞
#computer-vision

@h4nkdog: 我用 Codex 在客厅墙上随性编码了一个游戏!我通过计算机视觉 + 投影映射用手控制它

X AI KOLs Following ↗ · 6天前 缓存

一位用户展示了一个项目,该项目使用 OpenAI 的 Codex 编码了一个通过计算机视觉和投影映射用手势控制的游戏,并将在回复中分享延时摄影和过程。

0 人收藏 0 人点赞
#computer-vision

@DrTBehrens: Qwen-Image-2.1 测试:多参考图。

X AI KOLs Timeline ↗ · 6天前 缓存

一项测试,展示Qwen-Image-2.1模型处理多张参考图的能力。

0 人收藏 0 人点赞
#computer-vision

UltraTex: 释放2K多视角扩散在3D纹理生成中的潜力

Hugging Face Daily Papers ↗ · 2026-09-19 缓存

UltraTex是一个高效框架,用于基于高分辨率多视角扩散的3D纹理生成,引入了技术以减少冗余并在训练和推理中实现显著加速。

0 人收藏 0 人点赞
#computer-vision

斯坦福大学深度学习计算机视觉课程,由李飞飞教授 (@drfeifei) 授课:"演化力量驱动智能…"

X AI KOLs Timeline ↗ · 2026-09-18 缓存

斯坦福大学由李飞飞教授讲授的计算机视觉深度学习课程现已在YouTube上提供,探讨了视觉在发展智能过程中的演化作用。

0 人收藏 0 人点赞
#computer-vision

Fei-Fei Li 刚刚承认,她自己产品中最困难的部分不是 AI,而是将其推出市场。

Reddit r/artificial ↗ · 2026-09-17

Fei-Fei Li 的 AI 3D 重建模型在作为可靠产品推出时面临重大挑战,突显了研究与实际应用之间的差距。文章将其与 LiDAR 进行比较,讨论了在建筑和设计等行业中精度和可访问性的权衡。

0 人收藏 0 人点赞
#computer-vision

黑客揭示Flock摄像头实际如何追踪汽车和人

Ars Technica ↗ · 2026-09-17 缓存

黑客入侵了Flock Safety摄像头,复制数据以揭示该系统详细追踪车辆和人员,引发隐私担忧并暴露了监控能力。

0 人收藏 0 人点赞
#computer-vision

102张原始库存照片 → 22个实时eBay列表。现在我正尝试减少AI使用

Reddit r/artificial ↗ · 2026-09-17

作者测试了一个AI系统,将原始库存照片转化为eBay列表,发现确保正确推理和处理市场特性比初步物品识别更具挑战性。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈