标签
Gbrain的梦境循环是一个24/7全天候自动化循环,它摄入每日数据、丰富实体、整合对话、合并重复、修复引用、对页面进行排序,以维护一个新鲜且准确的知识库。
本文介绍并实证评估了使用知识图谱嵌入测量知识图谱间语义相似性的方法,提出了EmbPairSim和AvgEmbSim评分函数,这些函数在WikiText-2和CC-News数据集上优于Sentence-BERT等基线方法。
YouTube创始人Chad Hurley讲述了受PayPal支付按钮策略启发,免费嵌入视频的功能如何推动了YouTube的爆发式增长。文章重点介绍了a16z合伙人Chris Dixon提倡的‘为工具而来,为网络而留’策略。
DREAM通过利用自回归语言模型的注意力来监督查询-文档相似度,从而训练密集检索嵌入,无需标注数据。在不同模型规模下,它在BEIR和RTEB基准测试上始终优于基线。
HAKARI-Bench是一个轻量级基准测试,用于在多种配置和语言下比较检索方法,支持高效的模型选择和性能分析。它能在保持高相关性的同时,比运行完整基准测试(如MTEB)更快地复现其结果。
EvoEmbedding是一种动态嵌入模型,它维护一个持续更新的潜在记忆,为长上下文检索生成自适应表示,性能优于更大的专业模型,并改进智能体工作流。
Liquid AI 推出 LFM2.5-Embedding-350M 和 LFM2.5-ColBERT-350M,这两款多语言检索模型经过优化,可在11种语言中实现快速准确的搜索,延迟低至1.5毫秒。
本文介绍CADE,一个用于时间序列问答的框架,它直接将每个时间步映射到LLM嵌入空间,并使用单向监督对比损失将时间序列表示与冻结的文本锚点对齐,在Time-MQA基准测试上超越了现有基线。
一条中文科普推文,用直观方式解释了LLM(大语言模型)的核心链路:从token、embedding、位置编码、attention、FFN到残差流和next-token prediction,帮助非数学背景读者理解AI论文。
本文将对法医作者身份鉴定中的似然比框架应用于日语文本,融合了风格测量特征与基于嵌入的系统,以提高区分度和校准性能。
这篇博文解释了JEPA(联合嵌入预测架构)模型与典型相关分析(CCA)之间的联系,典型相关分析是一种源于1936年的统计方法,文章认为CCA是JEPA的概念前身,并指出在嵌入空间中最大化相关性的思想可追溯到Hotelling。
一个名为 turbovec 的开源项目在 GitHub 上获得了 1 万星标。它是一个基于 Rust、带有 Python 绑定的向量索引,使用谷歌研究的 TurboQuant 算法将嵌入压缩到接近理论香农极限,使得完全本地的 RAG(检索增强生成)成为可能——1000 万文档仅需 4 GB RAM,且搜索速度快于 FAISS。
本文研究了词汇重叠(而非语义内容)如何影响跨层和跨架构的大语言模型表示,并证明即使在为语义相似性训练的模型中,这种词汇效应依然存在,导致下游任务性能下降。
本文提出用于胸部X光报告生成中强化学习的集合距离奖励,该方法利用生成报告与参考报告之间基于嵌入的集合到集合距离。通过GRPO使用这些奖励进行后训练,在监督微调和精确匹配奖励上表现持续更优,并实现了高效的测试时扩展。
ScaleMAP是一种新的非线性降维方法,通过基于原始空间局部半径重新缩放嵌入距离来保持局部密度和邻域结构,在保持UMAP级别邻域保留的同时,实现了比DensMAP更好的密度保留。
这篇论文提出了一种通过统计描述符和句子嵌入来对异构数值表格数据集进行跨表检索和对齐的方法,无需共享列名即可实现相似性匹配与可解释的变量级对应。
本文提出了一种基于模型的方法来评估大规模多语言平行数据,将其分解为平行性评估和无参考质量估计,发现没有任何单一的通用指标适用于所有语言方向。
Xetrieval 是一个机械性框架,通过用推理信息增强句子嵌入并将其分解为可解释的稀疏特征来解释稠密检索,从而在不进行昂贵自回归生成的情况下提供检索决策的特征级解释。
Unveil提出了一个用于多模态文档检索的统一视觉-文本嵌入框架,通过知识蒸馏将语义理解从视觉-文本模型转移到纯视觉模型,实现鲁棒且高效的检索。
Garry Tan发布了新的gbrain-evals基准测试,显示ZeroEntropy.dev在重新排名和嵌入成本、速度及检索成功率方面达到SOTA,击败了MemPalace和Vector RAG。