标签
MIT Senseable City Lab的研究人员在一本新书中讨论了使用视觉AI分析城市环境的方法,强调了其在城市规划中的潜力,同时探讨了隐私和公平性方面的担忧。
Ryan Sael 展示了 Opus 5.5 能够在不到两小时内以低成本创建一个用于相机对焦教育的交互式镜头实验室,突显了先进的AI原型设计能力。
一位开发者分享了在本地硬件上将对象检测延迟降低到0.35秒以下的成就,突显了人工智能性能优化的进展。
本文介绍了SCoR,一种用于预测科学概念之间关系的层次框架,其中包含一个基准和模型,通过预测类型化关系来改进研究方向的发现。
ImIR 通过使用源自图像的指令,适配预训练图像编辑模型以执行六种图像修复任务,实现高效且任务无关的修复。
本文介绍了ScriptMoE,一种用于一体化多语言场景文本识别的脚本感知混合专家架构,以及TextMuSS-10M合成数据集,在基准测试中取得了最先进的准确率。
本文介绍了Segment-Snap,一种结合几何与语义线索的方法,以提升三维场景中的交互理解,在运动门控AP和手柄检测指标上取得了显著提升。
SAM 3.1可以使用Meta Model API上的文本提示来检测、分割和跟踪图像和视频中的对象,并具有指定的推理费用。
一位用户展示了一个项目,该项目使用 OpenAI 的 Codex 编码了一个通过计算机视觉和投影映射用手势控制的游戏,并将在回复中分享延时摄影和过程。
一项测试,展示Qwen-Image-2.1模型处理多张参考图的能力。
UltraTex是一个高效框架,用于基于高分辨率多视角扩散的3D纹理生成,引入了技术以减少冗余并在训练和推理中实现显著加速。
斯坦福大学由李飞飞教授讲授的计算机视觉深度学习课程现已在YouTube上提供,探讨了视觉在发展智能过程中的演化作用。
Fei-Fei Li 的 AI 3D 重建模型在作为可靠产品推出时面临重大挑战,突显了研究与实际应用之间的差距。文章将其与 LiDAR 进行比较,讨论了在建筑和设计等行业中精度和可访问性的权衡。
黑客入侵了Flock Safety摄像头,复制数据以揭示该系统详细追踪车辆和人员,引发隐私担忧并暴露了监控能力。
作者测试了一个AI系统,将原始库存照片转化为eBay列表,发现确保正确推理和处理市场特性比初步物品识别更具挑战性。
本文提出了一种训练自适应卷积稀疏编码框架,该框架利用信息瓶颈原理实现鲁棒视觉表示,在CIFAR和ImageNet数据集上,在输入扰动下取得了性能提升。
FAMOS 是一个前馈模型,它使用多状态关节变换器和程序化数据生成器,从稀疏点云中预测可移动部分分割和关节参数,在实验中显示出相比基线方法的一致性改进。
Stability AI的研究团队在第19届欧洲计算机视觉大会上展示了关于AI生成图像颜色一致性的新工作,解决了确保镜头间颜色匹配的生产挑战。
NVIDIA 在 Hugging Face 上发布了 FoundationPose,这是一个用于6-DoF物体位姿估计与跟踪的统一基础模型,无需微调即可用于新物体。
本文提出自适应互惠知识蒸馏(AR-KD),这是一种新方法,通过关系对齐简化教师模型的输出分布,从而改善从教师到学生的知识传递,在CIFAR-100和ImageNet-1k数据集上实现了高达7.13%的准确率提升。