clip

标签

Cards List
#clip

视觉世界实验中的注视行为可用现成的语言-视觉编码器建模

arXiv cs.CL · 3天前 缓存

本文提出使用现成的CLIP风格多模态编码器,结合双模态归因方法来预测视觉世界实验中的注视行为,无需微调即可成功复现一项关于人类预测加工的开创性研究。

0 人收藏 0 人点赞
#clip

CT-Merging: 共识方向与任务级缩放用于LoRA适配器合并

arXiv cs.LG · 2026-07-24 缓存

CT-Merging 提出了一种通过从任务子空间投影器估计共识方向并分配任务级RMS系数缩放来合并LoRA适配器的方法,在DC-Merge CLIP适配器基准上取得了优越的性能。

0 人收藏 0 人点赞
#clip

CLIP潜在空间的超球面几何:一个语义混合模型

arXiv cs.LG · 2026-07-16 缓存

本文提出使用单位超球面上的von Mises-Fisher分布混合模型来建模CLIP潜在空间,比高斯假设更好地捕捉其方向性和多模态结构。该模型改善了长尾分布和分布外检测,并提供了CLIP嵌入的语义分解。

0 人收藏 0 人点赞
#clip

MedPMC:一种为基础模型扩展高保真医疗多模态数据的系统框架

Hugging Face Daily Papers · 2026-07-08 缓存

MedPMC是一个自动化框架,将医学文献转化为用于基础模型的高保真多模态数据,在多个基准测试和临床场景中取得了显著改进。

0 人收藏 0 人点赞
#clip

基于奖励门控的CLIP选择性测试时去偏

arXiv cs.CL · 2026-07-02 缓存

介绍了奖励门控测试时自适应(RG-TTA),这是一个强化学习框架,根据输入的偏差敏感性选择性地对CLIP模型应用去偏,解决了公平性与效用之间的权衡问题。

0 人收藏 0 人点赞
#clip

ComMem: 用于视觉语言模型测试时自适应的互补记忆系统

arXiv cs.AI · 2026-06-30 缓存

ComMem 提出了受生物记忆启发的互补记忆系统,以改进视觉语言模型的测试时自适应,在15个基准测试上超越了现有最先进方法。

0 人收藏 0 人点赞
#clip

碰撞前的预见:基于冻结视觉语言模型的预测性安全强化学习

arXiv cs.LG · 2026-06-11 缓存

本文提出VLM-Safe-RL框架,该框架将冻结的视觉语言模型集成到约束MDP的拉格朗日更新中,为高速视觉控制任务的安全强化学习提供预测性成本信号。该方法在Safety-Gymnasium FormulaOne L2上优于标准约束感知基线,并能泛化到未见过的环境。

0 人收藏 0 人点赞
#clip

KODA:面向视觉-语言基础模型的对比表示比较与对齐

arXiv cs.LG · 2026-06-04 缓存

本文介绍了KODA(Kernel Optimization for Discrepancy Analysis,差异分析核优化),一种基于核的框架,用于比较和对齐视觉-语言模型表示,通过识别在CLIP、SigLIP和BLIP等模型中聚类方式不同的样本子集。该方法使用对比嵌入聚类和随机低维近似,能够扩展到大型数据集,同时提供表示之间可解释的结构差异。

0 人收藏 0 人点赞
#clip

BRepCLIP: BRep基元的对比多模态预训练用于CAD理解

Hugging Face Daily Papers · 2026-06-03 缓存

BRepCLIP提出了在边界表示(BRep)基元上的对比多模态预训练方法,用于CAD理解,将BRep几何与语言和图像嵌入对齐,实现了最先进的检索和零样本分类性能。

0 人收藏 0 人点赞
#clip

嵌入模型如何绑定概念?

Hugging Face Daily Papers · 2026-05-29 缓存

本文探讨了CLIP为何在概念绑定上表现不佳,表明虽然CLIP的绑定函数复杂度高,但受控的Transformer模型可以通过乘法交互学习复杂度较低的绑定函数,从而更好地泛化。

0 人收藏 0 人点赞
#clip

FAST-GOAL: 快速高效的全局-局部对象对齐学习

arXiv cs.AI · 2026-05-27 缓存

FAST-GOAL 是一种微调方法,增强了CLIP在图像和长文本中对其全局和局部语义的能力,引入了FLISM和TSL模块以及GLIT100k数据集,在长标题数据集上取得了改进。

0 人收藏 0 人点赞
#clip

在推理时将图像指导注入文本条件扩散模型

Hugging Face Daily Papers · 2026-05-24 缓存

视觉概念融合(VCF)使得扩散模型在推理时能够同时以图像和文本提示作为条件,无需重新训练,通过轻量级对齐器和融合策略实现。

0 人收藏 0 人点赞
#clip

SafeDiffusion-R1: 在线奖励引导的安全扩散后训练

Hugging Face Daily Papers · 2026-05-18 缓存

SafeDiffusion-R1 引入了一个基于 GRPO 和引导奖励机制的在线强化学习框架,用于提升扩散模型的安全性,无需监督数据或奖励调优,在多个有害类别上实现了最先进的性能。

0 人收藏 0 人点赞
#clip

稀疏自编码器实现CLIP模型的鲁棒且可解释的微调

Hugging Face Daily Papers · 2026-05-15 缓存

SAE-FT提出了一种新颖的CLIP模型微调方法,利用稀疏自编码器约束来正则化视觉表示,在保持性能的同时提高对分布变化的鲁棒性,并实现可解释性。

0 人收藏 0 人点赞
#clip

FeatCal: 后合并模型的特征校准

Hugging Face Daily Papers · 2026-05-13 缓存

FeatCal是一种校准方法,通过逐层权重更新(无需梯度下降)来缩小后合并模型的性能差距,在CLIP和GLUE基准测试上以高样本效率取得了优异结果。

0 人收藏 0 人点赞
#clip

TTL:使用预训练视觉-语言模型的测试时文本学习框架用于OOD检测

arXiv cs.CL · 2026-04-20 缓存

TTL引入了一个测试时文本学习框架,用于使用CLIP等预训练视觉-语言模型进行OOD检测,该框架能够从未标记的测试流中动态学习OOD语义,无需外部OOD标签。该方法使用伪标记样本和OOD知识净化策略来提高检测的鲁棒性,应对多样化和不断演变的OOD分布。

0 人收藏 0 人点赞
#clip

使用CLIP潜在表示的分层文本条件图像生成

OpenAI Blog · 2022-04-13 缓存

OpenAI提出了一个使用CLIP潜在表示进行文本条件图像生成的分层两阶段模型:一个先验模型从文本标题生成CLIP图像嵌入,以及一个基于扩散的解码器从嵌入生成图像。该方法提高了图像多样性,并实现了零样本语言引导图像操作。

0 人收藏 0 人点赞
#clip

异星绮梦:新兴艺术图景

ML at Berkeley · 2021-06-30 缓存

本文聚焦于利用 OpenAI 的 CLIP 模型作为生成式模型引导机制的新兴 AI 生成艺术场景,展示了多种文本转图像的生成实例。

0 人收藏 0 人点赞
#clip

人工神经网络中的多模态神经元

OpenAI Blog · 2021-03-04 缓存

OpenAI 在 CLIP 中发现了多模态神经元,它们在不同模态(视觉、符号、文本)中对同一概念做出响应,这与生物神经元的行为相似,解释了该模型在困难视觉任务上的鲁棒性。这项可解释性研究为我们理解视觉-语言模型如何组织和表示抽象概念提供了深刻见解。

0 人收藏 0 人点赞
#clip

zsxkib/jina-clip-v2

Replicate Explore · 2026-07-21 缓存

Jina CLIP v2 是一个改进的多模态嵌入模型,支持 89 种语言、高分辨率图像和灵活的嵌入维度,性能比 v1 提升 3%,在多语言基准测试上达到最先进水平。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈