标签
Stability AI的研究团队在第19届欧洲计算机视觉大会上展示了关于AI生成图像颜色一致性的新工作,解决了确保镜头间颜色匹配的生产挑战。
NVIDIA 在 Hugging Face 上发布了 FoundationPose,这是一个用于6-DoF物体位姿估计与跟踪的统一基础模型,无需微调即可用于新物体。
本文提出自适应互惠知识蒸馏(AR-KD),这是一种新方法,通过关系对齐简化教师模型的输出分布,从而改善从教师到学生的知识传递,在CIFAR-100和ImageNet-1k数据集上实现了高达7.13%的准确率提升。
本文介绍了TAPe+MLv3,一种紧凑的计算机视觉系统,它使用结构化表示进行多任务学习,在COCO等基准测试上取得了具有竞争力的性能,且参数少于100,000。
对抗性时尚正作为一种创意回应针对AI驱动的监控而兴起,使用彩色图案和设计来规避物体检测系统,例如noRecognition和Cap_able等项目和产品已经可用。
已开发名为ChessInsights AI的浏览器扩展,使用100%客户端计算机视觉进行实时棋盘检测与分析,通过在本地处理所有数据确保隐私,无需服务器上传。
Sentradel正在招聘,并描述了他们的自主反无人机系统,该系统利用视觉和热感应技术,经济高效地探测、跟踪和对抗小型无人机。
rtmlib是一个轻量级、开源的姿态估计库,支持全身、手部、面部和动物姿态跟踪,基于rtmpose和vitpose模型构建,内置Gradio网页用户界面。
RelateAnything 是一个轻量级的实时开放词汇关系预测模型,它接受任意的谓词词汇和区域来源,在大型几何验证数据集上训练,并在新的跨数据集基准测试中进行评估,显示出比同类方法显著的性能提升。
Tesla的全自动驾驶(FSD)系统能有效处理阳光眩光场景,正如一位用户在推文中分享的积极体验所示,突显其先进的光子计数重建能力。
MultiMatte 是一个可提示的图像背景移除模型,基于 SAM 3 使用 LoRA 进行微调,通过输出 alpha 遮罩来更好地处理模糊边界,在基准测试中实现了更高的准确性。
一个结合了本地AI与GPT-6 Astra的篮球AI系统,用于检测和追踪球员、通过OCR识别球员号码,并为体育分析映射运动轨迹。
本文介绍了EPIC-Contact,一个用于3D手部-物体姿态估计的野外数据集,以及HOPformer,一个Transformer模型,能够从单张RGB图像联合预测手部和物体姿态。
本文介绍了TRACE,一个用于火灾后物体理解的基准,并提出了特征恢复模块(FRM),以恢复退化特征,提高在严重物理损坏下的检测和视觉语言任务性能。
FreeFlow是一种用于光流估计的层级Transformer,它消除了任务特定的归纳偏差,并在Sintel和KITTI-2015等基准测试中达到了最先进的精度。
本文介绍了 World in World,这是一个无需训练的接口,可以通过使用对应引导查询和基于证据的注意力指导,在冻结的自回归视频世界模型中实现灵活的相机和时间控制。
RCWM引入了一种递归框架,用于从单张图像重建复杂3D世界为可执行代码,使用全局-局部-全局递归并超越先前方法。
Desert Ant Labs 提供适用于语音、文本和视觉的小型专业AI模型,这些模型可在设备上离线运行,并配备SDK以便轻松集成,且无使用费用。
一篇关于使用多视图匹配和单目先验对任意图像集进行光束调整的研究论文,在计算机视觉中取得了最先进的结果。
在ECCV 2026的AI City挑战赛中,展示了开发稳健视觉AI系统的获胜者,其中顶级解决方案在视频预测中使用NVIDIA Cosmos世界基础模型,用于场景理解和预测等任务。