标签
作者测试了一个AI系统,将原始库存照片转化为eBay列表,发现确保正确推理和处理市场特性比初步物品识别更具挑战性。
本文提出了一种训练自适应卷积稀疏编码框架,该框架利用信息瓶颈原理实现鲁棒视觉表示,在CIFAR和ImageNet数据集上,在输入扰动下取得了性能提升。
FAMOS 是一个前馈模型,它使用多状态关节变换器和程序化数据生成器,从稀疏点云中预测可移动部分分割和关节参数,在实验中显示出相比基线方法的一致性改进。
Stability AI的研究团队在第19届欧洲计算机视觉大会上展示了关于AI生成图像颜色一致性的新工作,解决了确保镜头间颜色匹配的生产挑战。
NVIDIA 在 Hugging Face 上发布了 FoundationPose,这是一个用于6-DoF物体位姿估计与跟踪的统一基础模型,无需微调即可用于新物体。
本文提出自适应互惠知识蒸馏(AR-KD),这是一种新方法,通过关系对齐简化教师模型的输出分布,从而改善从教师到学生的知识传递,在CIFAR-100和ImageNet-1k数据集上实现了高达7.13%的准确率提升。
本文介绍了TAPe+MLv3,一种紧凑的计算机视觉系统,它使用结构化表示进行多任务学习,在COCO等基准测试上取得了具有竞争力的性能,且参数少于100,000。
对抗性时尚正作为一种创意回应针对AI驱动的监控而兴起,使用彩色图案和设计来规避物体检测系统,例如noRecognition和Cap_able等项目和产品已经可用。
已开发名为ChessInsights AI的浏览器扩展,使用100%客户端计算机视觉进行实时棋盘检测与分析,通过在本地处理所有数据确保隐私,无需服务器上传。
Sentradel正在招聘,并描述了他们的自主反无人机系统,该系统利用视觉和热感应技术,经济高效地探测、跟踪和对抗小型无人机。
rtmlib是一个轻量级、开源的姿态估计库,支持全身、手部、面部和动物姿态跟踪,基于rtmpose和vitpose模型构建,内置Gradio网页用户界面。
RelateAnything 是一个轻量级的实时开放词汇关系预测模型,它接受任意的谓词词汇和区域来源,在大型几何验证数据集上训练,并在新的跨数据集基准测试中进行评估,显示出比同类方法显著的性能提升。
Tesla的全自动驾驶(FSD)系统能有效处理阳光眩光场景,正如一位用户在推文中分享的积极体验所示,突显其先进的光子计数重建能力。
MultiMatte 是一个可提示的图像背景移除模型,基于 SAM 3 使用 LoRA 进行微调,通过输出 alpha 遮罩来更好地处理模糊边界,在基准测试中实现了更高的准确性。
一个结合了本地AI与GPT-6 Astra的篮球AI系统,用于检测和追踪球员、通过OCR识别球员号码,并为体育分析映射运动轨迹。
本文介绍了EPIC-Contact,一个用于3D手部-物体姿态估计的野外数据集,以及HOPformer,一个Transformer模型,能够从单张RGB图像联合预测手部和物体姿态。
本文介绍了TRACE,一个用于火灾后物体理解的基准,并提出了特征恢复模块(FRM),以恢复退化特征,提高在严重物理损坏下的检测和视觉语言任务性能。
FreeFlow是一种用于光流估计的层级Transformer,它消除了任务特定的归纳偏差,并在Sintel和KITTI-2015等基准测试中达到了最先进的精度。
本文介绍了 World in World,这是一个无需训练的接口,可以通过使用对应引导查询和基于证据的注意力指导,在冻结的自回归视频世界模型中实现灵活的相机和时间控制。
RCWM引入了一种递归框架,用于从单张图像重建复杂3D世界为可执行代码,使用全局-局部-全局递归并超越先前方法。