computer-vision

标签

Cards List
#computer-vision

一体化多语言场景文本识别:基于脚本感知的混合专家模型

Hugging Face Daily Papers ↗ · 2026-09-21 缓存

本文介绍了ScriptMoE,一种用于一体化多语言场景文本识别的脚本感知混合专家架构,以及TextMuSS-10M合成数据集,在基准测试中取得了最先进的准确率。

0 人收藏 0 人点赞
#computer-vision

三维场景交互理解的几何与语义耦合

Hugging Face Daily Papers ↗ · 2026-09-21 缓存

本文介绍了Segment-Snap,一种结合几何与语义线索的方法,以提升三维场景中的交互理解,在运动门控AP和手柄检测指标上取得了显著提升。

0 人收藏 0 人点赞
#computer-vision

Segment Anything Model (SAM) 3.1(2分钟阅读)

TLDR AI ↗ · 2026-09-21

SAM 3.1可以使用Meta Model API上的文本提示来检测、分割和跟踪图像和视频中的对象,并具有指定的推理费用。

0 人收藏 0 人点赞
#computer-vision

@h4nkdog: 我用 Codex 在客厅墙上随性编码了一个游戏!我通过计算机视觉 + 投影映射用手控制它

X AI KOLs Following ↗ · 2026-09-20 缓存

一位用户展示了一个项目,该项目使用 OpenAI 的 Codex 编码了一个通过计算机视觉和投影映射用手势控制的游戏,并将在回复中分享延时摄影和过程。

0 人收藏 0 人点赞
#computer-vision

@DrTBehrens: Qwen-Image-2.1 测试:多参考图。

X AI KOLs Timeline ↗ · 2026-09-20 缓存

一项测试,展示Qwen-Image-2.1模型处理多张参考图的能力。

0 人收藏 0 人点赞
#computer-vision

UltraTex: 释放2K多视角扩散在3D纹理生成中的潜力

Hugging Face Daily Papers ↗ · 2026-09-19 缓存

UltraTex是一个高效框架,用于基于高分辨率多视角扩散的3D纹理生成,引入了技术以减少冗余并在训练和推理中实现显著加速。

0 人收藏 0 人点赞
#computer-vision

斯坦福大学深度学习计算机视觉课程,由李飞飞教授 (@drfeifei) 授课:"演化力量驱动智能…"

X AI KOLs Timeline ↗ · 2026-09-18 缓存

斯坦福大学由李飞飞教授讲授的计算机视觉深度学习课程现已在YouTube上提供,探讨了视觉在发展智能过程中的演化作用。

0 人收藏 0 人点赞
#computer-vision

Fei-Fei Li 刚刚承认,她自己产品中最困难的部分不是 AI,而是将其推出市场。

Reddit r/artificial ↗ · 2026-09-17

Fei-Fei Li 的 AI 3D 重建模型在作为可靠产品推出时面临重大挑战,突显了研究与实际应用之间的差距。文章将其与 LiDAR 进行比较,讨论了在建筑和设计等行业中精度和可访问性的权衡。

0 人收藏 0 人点赞
#computer-vision

黑客揭示Flock摄像头实际如何追踪汽车和人

Ars Technica ↗ · 2026-09-17 缓存

黑客入侵了Flock Safety摄像头,复制数据以揭示该系统详细追踪车辆和人员,引发隐私担忧并暴露了监控能力。

0 人收藏 0 人点赞
#computer-vision

102张原始库存照片 → 22个实时eBay列表。现在我正尝试减少AI使用

Reddit r/artificial ↗ · 2026-09-17

作者测试了一个AI系统,将原始库存照片转化为eBay列表,发现确保正确推理和处理市场特性比初步物品识别更具挑战性。

0 人收藏 0 人点赞
#computer-vision

基于信息瓶颈的训练自适应卷积稀疏编码用于鲁棒视觉表示

Hugging Face Daily Papers ↗ · 2026-09-17 缓存

本文提出了一种训练自适应卷积稀疏编码框架,该框架利用信息瓶颈原理实现鲁棒视觉表示,在CIFAR和ImageNet数据集上,在输入扰动下取得了性能提升。

0 人收藏 0 人点赞
#computer-vision

FAMOS:基于稀疏观测的前馈三维关节建模

Hugging Face Daily Papers ↗ · 2026-09-17 缓存

FAMOS 是一个前馈模型,它使用多状态关节变换器和程序化数据生成器,从稀疏点云中预测可移动部分分割和关节参数,在实验中显示出相比基线方法的一致性改进。

0 人收藏 0 人点赞
#computer-vision

@StabilityAI:颜色一致性是生产环境中的持续痛点。我们的交互研究团队刚从第19……返回。

X AI KOLs Timeline ↗ · 2026-09-15

Stability AI的研究团队在第19届欧洲计算机视觉大会上展示了关于AI生成图像颜色一致性的新工作,解决了确保镜头间颜色匹配的生产挑战。

0 人收藏 0 人点赞
#computer-vision

@HuggingPapers: NVIDIA 刚在 Hugging Face 上发布了 FoundationPose 一个用于6-DoF物体位姿估计和跟踪的统一基础模型……

X AI KOLs Timeline ↗ · 2026-09-15 缓存

NVIDIA 在 Hugging Face 上发布了 FoundationPose,这是一个用于6-DoF物体位姿估计与跟踪的统一基础模型,无需微调即可用于新物体。

0 人收藏 0 人点赞
#computer-vision

通过自适应互惠知识蒸馏发现和保持类别相关知识

arXiv cs.LG ↗ · 2026-09-15 缓存

本文提出自适应互惠知识蒸馏(AR-KD),这是一种新方法,通过关系对齐简化教师模型的输出分布,从而改善从教师到学生的知识传递,在CIFAR-100和ImageNet-1k数据集上实现了高达7.13%的准确率提升。

0 人收藏 0 人点赞
#computer-vision

TAPe+ML:一种用于多任务计算机视觉的紧凑结构化表示

Hugging Face Daily Papers ↗ · 2026-09-15 缓存

本文介绍了TAPe+MLv3,一种紧凑的计算机视觉系统,它使用结构化表示进行多任务学习,在COCO等基准测试上取得了具有竞争力的性能,且参数少于100,000。

0 人收藏 0 人点赞
#computer-vision

对抗性时尚对AI全景监控表明立场

Hacker News Top ↗ · 2026-09-14 缓存

对抗性时尚正作为一种创意回应针对AI驱动的监控而兴起,使用彩色图案和设计来规避物体检测系统,例如noRecognition和Cap_able等项目和产品已经可用。

0 人收藏 0 人点赞
#computer-vision

[P] 构建了一个100%客户端视觉流水线,用于实时棋盘与多棋盘检测(Chrome/Firefox扩展) [P]

Reddit r/MachineLearning ↗ · 2026-09-14

已开发名为ChessInsights AI的浏览器扩展,使用100%客户端计算机视觉进行实时棋盘检测与分析,通过在本地处理所有数据确保隐私,无需服务器上传。

0 人收藏 0 人点赞
#computer-vision

@sts_3d: Sentradel正在招聘!更多信息请访问 https://sentradel.com。如果您私信我,请包含相关项目的细节 / 经验…

X AI KOLs Following ↗ · 2026-09-13 缓存

Sentradel正在招聘,并描述了他们的自主反无人机系统,该系统利用视觉和热感应技术,经济高效地探测、跟踪和对抗小型无人机。

0 人收藏 0 人点赞
#computer-vision

@oliviscusAI: 这个工具可以跟踪完美的3D运动。rtmlib是一个轻量级姿态估计库,涵盖全身、手部、面部等

X AI KOLs Following ↗ · 2026-09-13 缓存

rtmlib是一个轻量级、开源的姿态估计库,支持全身、手部、面部和动物姿态跟踪,基于rtmpose和vitpose模型构建,内置Gradio网页用户界面。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈