标签
本文介绍了一个开放基准测试和一个专门的双编码器模型,用于1C:Enterprise生态系统中的自然语言代码检索,解决了俄语代码搜索领域特定资源的缺乏问题。
Tevatron-Elastic 为训练弹性检索器和重排序器提供了统一抽象,使单个检查点能够在深度、token 和宽度轴上支持多种模型规模。它统一概括了 Matryoshka 嵌入和提前退出等先前方法,并引入了用于联合 token 压缩训练的 Matryoshka LTC。
QuixiAI发布embeddinggemma.c,一个用C编写的快速跨平台嵌入推理引擎,支持多种后端(CPU、Metal、CUDA、ROCm、SYCL)以及Matryoshka嵌入,并提供标准HTTP API。
CAMMAR引入了一个表示学习框架,通过分阶段的语义课程将阿拉伯语隐喻意义组织成嵌套的词汇、文化和隐喻子空间,在一个新的跨度标注数据集上实现了强大的隐喻检测(AUC高达0.84)。