标签
这条推文讨论了在没有真实标签的情况下为多边形输出设定质量指标的困难,但提出了一种可靠的三方协议方法。它强调了对于非专用视觉-语言模型而言令人印象深刻的结果,尽管存在假阳性/假阴性,并且注意到使用网格提示的改进。
文章介绍了如何使用LLM的logprobs参数实现Jev式封装,以支持结构化查询,并扩展到视觉模型,通过attachments字段处理图像,提供灵活且可定制的计算机视觉方法。
ImageJevBench v0.1 被介绍为一个用于评估 AI 模型在图像决策任务上的基准,基于性能、成本和校准指标对系统如 Jev-Omni 和 decider-2b-vision 进行排名。
Gen-HumanEgo 是 GenrobotAI 发布的新机器人学习数据集,包含超过1,800小时的自我中心人类数据、超过10,000个独特任务以及同步的相机视图,包括3D手部关键点和结构化注释。
MIT Senseable City Lab的研究人员在一本新书中讨论了使用视觉AI分析城市环境的方法,强调了其在城市规划中的潜力,同时探讨了隐私和公平性方面的担忧。
TrackEverything 引入了一种3D点跟踪器,通过基于体素的去重机制将视频表示为持久的3D场景轨迹,克服了稀疏长程跟踪与密集短程跟踪之间的权衡,在 TAPVid-3D 上实现了最先进的性能,并能在40GB GPU内存内处理超过1000帧的视频。
本文介绍了RGBD20K,这是一个用于RGB-D语义分割的大规模基准数据集,包含160个细粒度类别和20,000对图像,具有高质量注释和一种新颖的分数净化融合方法。
Ryan Sael 展示了 Opus 5.5 能够在不到两小时内以低成本创建一个用于相机对焦教育的交互式镜头实验室,突显了先进的AI原型设计能力。
一位开发者分享了在本地硬件上将对象检测延迟降低到0.35秒以下的成就,突显了人工智能性能优化的进展。
本文介绍了SCoR,一种用于预测科学概念之间关系的层次框架,其中包含一个基准和模型,通过预测类型化关系来改进研究方向的发现。
本文介绍了一个用于参考图像质量评估指标的全自动数据生成流水线,利用扩散模型中的分叉时刻作为感知距离的代理,该代理与人类视觉系统一致,并优于人工标注的数据集。
ImIR 通过使用源自图像的指令,适配预训练图像编辑模型以执行六种图像修复任务,实现高效且任务无关的修复。
本文介绍了ScriptMoE,一种用于一体化多语言场景文本识别的脚本感知混合专家架构,以及TextMuSS-10M合成数据集,在基准测试中取得了最先进的准确率。
本文介绍了Segment-Snap,一种结合几何与语义线索的方法,以提升三维场景中的交互理解,在运动门控AP和手柄检测指标上取得了显著提升。
SAM 3.1可以使用Meta Model API上的文本提示来检测、分割和跟踪图像和视频中的对象,并具有指定的推理费用。
一位用户展示了一个项目,该项目使用 OpenAI 的 Codex 编码了一个通过计算机视觉和投影映射用手势控制的游戏,并将在回复中分享延时摄影和过程。
一项测试,展示Qwen-Image-2.1模型处理多张参考图的能力。
UltraTex是一个高效框架,用于基于高分辨率多视角扩散的3D纹理生成,引入了技术以减少冗余并在训练和推理中实现显著加速。