标签
介绍了VectraYX-Vision-1B,这是一个面向西班牙语/拉丁美洲网络安全的亚20亿参数视觉语言模型,通过MLP将冻结的SigLIP编码器与西班牙语解码器耦合;然而,尽管流水线功能完全正常,它却报告了近乎为零的视觉基础能力,并提供了开源权重和修复计划。
一位研究人员报告,在细粒度汽车分类任务中使用k-NN时,冻结的SigLIP2(92%)和DINOv2(41%)嵌入之间存在惊人的50个百分点的准确率差距,寻求了解线性探针是否能缩小差距,或者DINOv2是否不适合检索。