通过对比预训练的文本和代码嵌入

OpenAI Blog 论文

摘要

# 通过对比预训练的文本和代码嵌入 源:[https://openai.com/index/text-and-code-embeddings-by-contrastive-pre-training/](https://openai.com/index/text-and-code-embeddings-by-contrastive-pre-training/) ## 摘要 文本嵌入是许多应用中的有用特征,例如语义搜索和计算文本相似性。以往的工作通常训练针对不同用例定制的模型,在数据集选择、训练目标和模型架构方面各不相同。在这

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/04/20 14:56

# 通过对比预训练的文本和代码嵌入 来源: https://openai.com/index/text-and-code-embeddings-by-contrastive-pre-training/ ## 摘要 文本嵌入在许多应用中都很有用,例如语义搜索和计算文本相似性。以往的工作通常训练针对不同用例定制的模型,在数据集选择、训练目标和模型架构上各不相同。在这项工作中,我们展示了在大规模无监督数据上进行对比预训练可以生成高质量的文本和代码向量表示。这些相同的无监督文本嵌入既能在线性探针分类中取得新的最先进结果,也能展示出令人印象深刻的语义搜索能力,有时甚至能与微调后的模型相竞争。在7个任务的线性探针分类准确率平均值上,我们最好的无监督模型相对于之前最好的无监督和监督文本嵌入模型分别实现了4%和1.8%的相对改进。相同的文本嵌入在大规模语义搜索评估中,相对于MSMARCO、Natural Questions和TriviaQA基准上之前最好的无监督方法分别实现了23.4%、14.7%和10.6%的相对改进。与文本嵌入类似,我们在(文本,代码)对上训练代码嵌入模型,相对于代码搜索领域之前最好的工作取得了20.8%的相对改进。

相似文章

介绍文本和代码嵌入

OpenAI Blog

OpenAI 推出了新的嵌入 API 端点,可以将文本和代码转换为数值向量表示,用于语义搜索、聚类和分类任务。这些模型在标准基准测试上取得了最先进的效果,包括代码搜索性能相比之下提升了 20%。

全新改进的嵌入模型

OpenAI Blog

OpenAI 发布了 text-embedding-ada-002,这是一个统一的嵌入模型,将之前的五个模型整合为一个,具有更出色的性能、4 倍更长的上下文窗口(8192 个令牌)、更小的维度(1536)以及比之前的 Davinci 嵌入模型低 99.8% 的定价。

通过无监督学习改进语言理解

OpenAI Blog

OpenAI 提出了一种两阶段方法来改进语言理解:首先在大规模无监督数据集上使用语言建模对 transformer 模型进行预训练,然后在较小的有监督数据集上针对特定任务进行微调。该方法在包括常识推理、语义相似度和阅读理解在内的多种任务上取得了最先进的成果,同时需要的超参数调优工作最少。

@lukaskuhn77: 我们推出了LeVLJEPA:首个完全非对比的端到端视觉语言预训练方法,性能可与C…相竞争。

X AI KOLs Following

LeVLJEPA是首个完全非对比的端到端视觉语言预训练方法,无需负样本、温度参数或动量编码器,性能即可与CLIP和SigLIP相媲美。它通过跨模态预测(使用停止梯度目标)和每模态分布正则化进行学习,为下游任务(如VLM主干网络和语义分割)提供更强的密集语义特征。