computer-vision

标签

Cards List
#computer-vision

@StabilityAI:颜色一致性是生产环境中的持续痛点。我们的交互研究团队刚从第19……返回。

X AI KOLs Timeline ↗ · 2026-09-15

Stability AI的研究团队在第19届欧洲计算机视觉大会上展示了关于AI生成图像颜色一致性的新工作,解决了确保镜头间颜色匹配的生产挑战。

0 人收藏 0 人点赞
#computer-vision

@HuggingPapers: NVIDIA 刚在 Hugging Face 上发布了 FoundationPose 一个用于6-DoF物体位姿估计和跟踪的统一基础模型……

X AI KOLs Timeline ↗ · 2026-09-15 缓存

NVIDIA 在 Hugging Face 上发布了 FoundationPose,这是一个用于6-DoF物体位姿估计与跟踪的统一基础模型,无需微调即可用于新物体。

0 人收藏 0 人点赞
#computer-vision

通过自适应互惠知识蒸馏发现和保持类别相关知识

arXiv cs.LG ↗ · 2026-09-15 缓存

本文提出自适应互惠知识蒸馏(AR-KD),这是一种新方法,通过关系对齐简化教师模型的输出分布,从而改善从教师到学生的知识传递,在CIFAR-100和ImageNet-1k数据集上实现了高达7.13%的准确率提升。

0 人收藏 0 人点赞
#computer-vision

TAPe+ML:一种用于多任务计算机视觉的紧凑结构化表示

Hugging Face Daily Papers ↗ · 2026-09-15 缓存

本文介绍了TAPe+MLv3,一种紧凑的计算机视觉系统,它使用结构化表示进行多任务学习,在COCO等基准测试上取得了具有竞争力的性能,且参数少于100,000。

0 人收藏 0 人点赞
#computer-vision

对抗性时尚对AI全景监控表明立场

Hacker News Top ↗ · 2026-09-14 缓存

对抗性时尚正作为一种创意回应针对AI驱动的监控而兴起,使用彩色图案和设计来规避物体检测系统,例如noRecognition和Cap_able等项目和产品已经可用。

0 人收藏 0 人点赞
#computer-vision

[P] 构建了一个100%客户端视觉流水线,用于实时棋盘与多棋盘检测(Chrome/Firefox扩展) [P]

Reddit r/MachineLearning ↗ · 2026-09-14

已开发名为ChessInsights AI的浏览器扩展,使用100%客户端计算机视觉进行实时棋盘检测与分析,通过在本地处理所有数据确保隐私,无需服务器上传。

0 人收藏 0 人点赞
#computer-vision

@sts_3d: Sentradel正在招聘!更多信息请访问 https://sentradel.com。如果您私信我,请包含相关项目的细节 / 经验…

X AI KOLs Following ↗ · 2026-09-13 缓存

Sentradel正在招聘,并描述了他们的自主反无人机系统,该系统利用视觉和热感应技术,经济高效地探测、跟踪和对抗小型无人机。

0 人收藏 0 人点赞
#computer-vision

@oliviscusAI: 这个工具可以跟踪完美的3D运动。rtmlib是一个轻量级姿态估计库,涵盖全身、手部、面部等

X AI KOLs Following ↗ · 2026-09-13 缓存

rtmlib是一个轻量级、开源的姿态估计库,支持全身、手部、面部和动物姿态跟踪,基于rtmpose和vitpose模型构建,内置Gradio网页用户界面。

0 人收藏 0 人点赞
#computer-vision

RelateAnything: 实时开放词汇关系预测,支持任意输入

Hugging Face Daily Papers ↗ · 2026-09-11 缓存

RelateAnything 是一个轻量级的实时开放词汇关系预测模型,它接受任意的谓词词汇和区域来源,在大型几何验证数据集上训练,并在新的跨数据集基准测试中进行评估,显示出比同类方法显著的性能提升。

0 人收藏 0 人点赞
#computer-vision

@Tesla: 光子计数重建,太棒了!

X AI KOLs Following ↗ · 2026-09-10 缓存

Tesla的全自动驾驶(FSD)系统能有效处理阳光眩光场景,正如一位用户在推文中分享的积极体验所示,突显其先进的光子计数重建能力。

0 人收藏 0 人点赞
#computer-vision

Show HN: MultiMatte,一个可提示的图像背景移除模型

Hacker News Top ↗ · 2026-09-10 缓存

MultiMatte 是一个可提示的图像背景移除模型,基于 SAM 3 使用 LoRA 进行微调,通过输出 alpha 遮罩来更好地处理模糊边界,在基准测试中实现了更高的准确性。

0 人收藏 0 人点赞
#computer-vision

@skalskip92: 篮球AI (95% 本地AI + 5% GPT-6 Astra) - 检测篮球和球员 - 追踪球员 - 跨回合重新识别球员……

X AI KOLs Timeline ↗ · 2026-09-10 缓存

一个结合了本地AI与GPT-6 Astra的篮球AI系统,用于检测和追踪球员、通过OCR识别球员号码,并为体育分析映射运动轨迹。

0 人收藏 0 人点赞
#computer-vision

@Michael_J_Black: 今日ECCV: 走向野外自我中心3D手部-物体姿态估计, 展览厅海报: #70, 下午CEST, 海报环节…

X AI KOLs Timeline ↗ · 2026-09-10 缓存

本文介绍了EPIC-Contact,一个用于3D手部-物体姿态估计的野外数据集,以及HOPformer,一个Transformer模型,能够从单张RGB图像联合预测手部和物体姿态。

0 人收藏 0 人点赞
#computer-vision

不可逆火灾损坏后的物体理解特征恢复

Hugging Face Daily Papers ↗ · 2026-09-10 缓存

本文介绍了TRACE,一个用于火灾后物体理解的基准,并提出了特征恢复模块(FRM),以恢复退化特征,提高在严重物理损坏下的检测和视觉语言任务性能。

0 人收藏 0 人点赞
#computer-vision

FreeFlow: 用于光流估计的无偏差层级Transformer

Hugging Face Daily Papers ↗ · 2026-09-10 缓存

FreeFlow是一种用于光流估计的层级Transformer,它消除了任务特定的归纳偏差,并在Sintel和KITTI-2015等基准测试中达到了最先进的精度。

0 人收藏 0 人点赞
#computer-vision

World in World: 用世界模型探索世界

Hugging Face Daily Papers ↗ · 2026-09-10 缓存

本文介绍了 World in World,这是一个无需训练的接口,可以通过使用对应引导查询和基于证据的注意力指导,在冻结的自回归视频世界模型中实现灵活的相机和时间控制。

0 人收藏 0 人点赞
#computer-vision

递归代码世界模型:通过递归场景程序构建复杂世界

Hugging Face Daily Papers ↗ · 2026-09-10 缓存

RCWM引入了一种递归框架,用于从单张图像重建复杂3D世界为可执行代码,使用全局-局部-全局递归并超越先前方法。

0 人收藏 0 人点赞
#computer-vision

Desert Ant Labs

Product Hunt ↗ · 2026-09-09 缓存

Desert Ant Labs 提供适用于语音、文本和视觉的小型专业AI模型,这些模型可在设备上离线运行,并配备SDK以便轻松集成,且无使用费用。

0 人收藏 0 人点赞
#computer-vision

@kwangmoo_yi: Leroy et al., "BLASt3R: Bundle Adjustment of Any Image Set with Multi-View Matching and Monocular Priors" 我们又回到了……

X AI KOLs Timeline ↗ · 2026-09-08 缓存

一篇关于使用多视图匹配和单目先验对任意图像集进行光束调整的研究论文,在计算机视觉中取得了最先进的结果。

0 人收藏 0 人点赞
#computer-vision

@NVIDIAAI: 视觉AI需要识别场景,理解发生了什么,并预测接下来可能发生什么。对于AI City挑战……

X AI KOLs Timeline ↗ · 2026-09-08 缓存

在ECCV 2026的AI City挑战赛中,展示了开发稳健视觉AI系统的获胜者,其中顶级解决方案在视频预测中使用NVIDIA Cosmos世界基础模型,用于场景理解和预测等任务。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈