标签
作者认为,Agent记忆层应跳过基于LLM的提取来决定记住什么,转而使用简单的存储、嵌入和检索,其开源工具memU即是例证。
介绍了B1ade,一种极简RAG架构,包含一个335M零训练嵌入模型和一个通过GRPO在723M tokens上训练的1B小型语言模型,展示了涌现归因行为,无需大规模预训练即可获得具有竞争力的问答性能。
描述了使用 ncnn 的 Vulkan 后端在生产级边缘设备上进行供应商无关的机器学习推理,在人脸检测和嵌入模型上相比 CPU ONNX 实现了 10 倍加速。
该项目提供自包含、高可移植性的Python发行版,运行时依赖极少,适用于将Python嵌入到更大的二进制文件中或在多样化的系统上运行。
Agentlas是一个免费、开源的智能体记忆系统,它使用本地SQLite数据库,结合轻量级嵌入和关键词搜索,无需调用LLM即可在LongMemEval上达到96.4%,性能优于mem0和supermemory等替代方案。
Fusion Embedding 引入了一个模型系列,将音频添加至冻结的视觉-语言嵌入主干网络,从而实现文本、图像、视频和音频检索的统一嵌入空间。该系列模型仅训练轻量级适配器,无需配对音视频数据即可实现音频-图像检索。
QuixiAI发布embeddinggemma.c,一个用C编写的快速跨平台嵌入推理引擎,支持多种后端(CPU、Metal、CUDA、ROCm、SYCL)以及Matryoshka嵌入,并提供标准HTTP API。
NVIDIA发布Nemotron 3 Embed,这是一组开源嵌入模型,在RTEB排行榜上名列前茅,包括一个80亿参数的旗舰模型以及适用于生产规模检索的高效10亿参数变体。
NVIDIA 发布了 Nemotron-3-Embed 1B 和 8B 模型,这是最先进的多语言文本嵌入模型,用于检索和语义相似度,针对 RAG 系统进行了优化。
NVIDIA发布了Nemotron-3-Embed-1B-BF16,一款针对检索和语义相似度优化的多语言文本嵌入模型,在34种语言上实现了RAG系统的最优性能。
Vultr发布了VultronRetriever系列模型,包括Prime-8B、Core-4.5B和Flash-0.8B,这些模型在MTEB排行榜上名列前茅,具有高效和离线能力。
本文提出了一种基于MiniLM嵌入的多簇边界学习方法用于离域意图检测,在CLINC150、StackOverflow和Banking77数据集上取得了最先进的性能。
InductWave提出了一种基于小波的归纳嵌入方法,用于知识图谱上的多跳逻辑查询回答,在更少的消息传递层数下实现了竞争性的性能。
Ternlight 是一个 7 MB 的嵌入模型,通过 WASM 在浏览器中运行,无需任何 API 调用或服务器即可实现快速语义搜索。它以 npm 包的形式提供,只需三行代码即可使用。
BaryGraph 提出了一种新颖的知识图谱,其中每个关系都是一等嵌入文档(BaryEdge),而不是节点之间的边,从而能够实现递归抽象三元组,揭示相距遥远概念之间的结构桥梁。预印本中包含了基准测试,显示结构度量比单独使用余弦相似度更能与人类相似性判断相关联。
本文介绍了 Ember,一种用于嵌入矩阵和语言模型头矩阵的轻量级优化器,它利用梯度几何来提高监督微调、强化学习和预训练中的效率和性能,同时使用的优化器状态远少于 Adam。
Gbrain的梦境循环是一个24/7全天候自动化循环,它摄入每日数据、丰富实体、整合对话、合并重复、修复引用、对页面进行排序,以维护一个新鲜且准确的知识库。
本文介绍并实证评估了使用知识图谱嵌入测量知识图谱间语义相似性的方法,提出了EmbPairSim和AvgEmbSim评分函数,这些函数在WikiText-2和CC-News数据集上优于Sentence-BERT等基线方法。
YouTube创始人Chad Hurley讲述了受PayPal支付按钮策略启发,免费嵌入视频的功能如何推动了YouTube的爆发式增长。文章重点介绍了a16z合伙人Chris Dixon提倡的‘为工具而来,为网络而留’策略。