embeddings

标签

Cards List
#embeddings

@garrytan: GBrain现在可以使用嵌入向量,通过'brainstorm'和'brainstorm with lsd mode (latera…'来为你寻找反主流观点。

X AI KOLs Following · 2026-05-20 缓存

OpenCollider的研究人员展示了上下文工程技术可以提高原创性,现在GBrain利用嵌入向量,通过其'brainstorm'和'brainstorm with lsd mode'功能帮助用户找到反主流想法。

0 人收藏 0 人点赞
#embeddings

使用知识图谱嵌入的自动化大数据质量评估

arXiv cs.LG · 2026-05-20

本文介绍了一种基于知识的方法,利用知识图谱嵌入,通过预测上下文表示与质量规则之间的缺失边来自动评估大数据质量,优于传统的匹配方法。

0 人收藏 0 人点赞
#embeddings

你的AI记忆的可信度分数是嵌入模型的外键,该模型可能在六个月后不复存在。

Reddit r/AI_Agents · 2026-05-19

关于AI记忆系统的一个关键观察:当模型被替换时,与嵌入模型绑定的可信度分数会失效,而由于嵌入向量发生变化,重新校准也变得毫无意义。作者质疑是否有人在不重建信任逻辑的情况下解决了这个问题。

0 人收藏 0 人点赞
#embeddings

Witchcraft:基于SQLite的快速本地语义搜索 [P]

Reddit r/MachineLearning · 2026-05-18

Witchcraft 是一个用 Rust 对斯坦福大学 XTR-Warp 语义搜索引擎进行的开源重新实现,使用 SQLite 实现快速本地搜索。它包含 Pickbrain CLI,用于索引代码会话记录,并为 AI 代理配备全局记忆。

0 人收藏 0 人点赞
#embeddings

Papr Graph

Product Hunt · 2026-05-16

Papr Graph 提供图原生的向量嵌入,通过基于图的能力升级传统嵌入。

0 人收藏 0 人点赞
#embeddings

Granite Embedding Multilingual R2:基于Apache 2.0的开源多语言嵌入模型,支持32K上下文——参数量低于1亿的检索质量最佳

Hugging Face Blog · 2026-05-14 缓存

IBM发布Granite Embedding Multilingual R2,这是一系列基于Apache 2.0的开源多语言嵌入模型,包含一个紧凑的97M参数模型,实现了参数量低于1亿的同类最佳检索质量,以及一个采用Matryoshka嵌入的311M参数模型,两者均支持32K上下文和200多种语言。

0 人收藏 0 人点赞
#embeddings

层表示动力学:跨嵌入器和基础大语言模型的实证研究

arXiv cs.LG · 2026-05-14 缓存

本文引入了层表示动力学(LRD),这是一个包含三个测量家族的框架,用于分析语言模型中各层隐藏状态的变化。应用于30个MTEB任务上的31个模型,LRD揭示了架构差异,并实现了无标签模型选择和推理时层剪枝。

0 人收藏 0 人点赞
#embeddings

Embeddings 用于偏好,而非语义

arXiv cs.AI · 2026-05-12 缓存

本文介绍了一种新的 embedding 模型,旨在捕捉偏好相似性,而不仅仅是语义相似性,从而提高了集体决策系统中的偏好预测能力。

0 人收藏 0 人点赞
#embeddings

在 LongMemEval-S 上对智能体记忆检索进行基准测试 — Recall@5 达 98%,R@23 实现 100% 召回,仅依赖本地嵌入模型 (all-MiniLM-L6-v2),无需 LLM 与 API Key

Reddit r/AI_Agents · 2026-05-11

作者分享了用于智能体记忆的 Python 库 memweave 的基准测试结果,该库仅使用本地嵌入且无需调用 LLM,便在 LongMemEval-S 上实现了 98% 的 Recall@5。本文详细介绍了实现方法,并与 mempalace 进行了性能对比,突出了其在不同问题类型上稳定的检索表现。

0 人收藏 0 人点赞
#embeddings

代理预设:从语义嵌入到有效的社会测量

arXiv cs.CL · 2026-05-11 缓存

本文批评了自然语言处理(NLP)中的“代理预设”,即错误地将几何嵌入属性与社会构念等同起来。文章提出了结构效度协议(Construct Validity Protocol)和反事实中立化(Counterfactual Neutralization)方法,以确保对源自语义嵌入的社会测量进行严格的验证。

0 人收藏 0 人点赞
#embeddings

ProtSent:蛋白质句子转换器

arXiv cs.LG · 2026-05-11 缓存

本文介绍了 ProtSent,这是一个用于蛋白质语言模型的对比微调框架,能够提升嵌入质量,从而优化远程同源性检测和结构检索等下游任务。

0 人收藏 0 人点赞
#embeddings

MulTaBench:基于文本与图像的多模态表格学习基准测试

Hugging Face Daily Papers · 2026-05-11 缓存

介绍了 MulTaBench,一个包含40个数据集的基准测试,用于文本和图像模态的多模态表格学习。实验表明,任务特定的嵌入调优优于冻结的预训练嵌入,特别是在模态提供互补预测信号时。

0 人收藏 0 人点赞
#embeddings

@probnstat: 每位机器学习工程师都应了解的一个定理:Johnson-Lindenstrauss 引理。它指出,高维数据可以……

X AI KOLs Following · 2026-05-09

本文重点介绍了 Johnson-Lindenstrauss 引理,解释了其在帮助机器学习工程师理解降维、随机投影和嵌入效率方面的重要性。

0 人收藏 0 人点赞
#embeddings

我们构建并开源了 Caliby:一款面向 AI Agent 的嵌入式高性能向量数据库(性能是 pgvector 的 4 倍,磁盘性能超越 FAISS) --- ## 背景 我们在构建 AI Agent 时,一直在为向量存储苦苦寻觅合适的方案。 - **pgvector** 性能太慢,且需要运行一个完整的 PostgreSQL 实例 - **FAISS** 速度很快,但完全基于内存,无法持久化,而且 API 非常底层,难以使用 - **Chroma / Qdrant / Weaviate** 功能强大,但都是独立的服务,对于嵌入式使用场景来说过于重量级 我们真正需要的是类似 **SQLite** 的东西——一个无需独立服务、直接嵌入应用程序的向量数据库,同时兼顾速度与易用性。 于是,我们动手构建了它。 --- ## Caliby 是什么? **Caliby** 是一款嵌入式向量数据库,专为 AI Agent 和本地 AI 应用设计。 **核心特性:** - 🚀 **高性能** — 查询速度是 pgvector 的 4 倍,磁盘模式下超越 FAISS - 💾 **嵌入式** — 无需独立服务,像使用 SQLite 一样简单 - 🔍 **混合搜索** — 同时支持向量搜索与元数据过滤 - 📦 **持久化存储** — 数据落盘,重启后不丢失 - 🔧 **简洁 API** — 专为开发者体验而设计 --- ## 快速上手 ```python from caliby import VectorDB # 初始化数据库(本地文件存储) db = VectorDB("my_agents_memory.db") # 插入向量 db.insert( id="doc_1", vector=[0.1, 0.2, 0.3, ...], metadata={"source": "arxiv", "topic": "AI"} ) # 语义搜索 results = db.search( query_vector=[0.1, 0.2, 0.3, ...], top_k=5, filter={"topic": "AI"} ) ``` --- ## 性能基准测试 我们在 100 万条向量、维度为 1536(OpenAI embedding 维度)的数据集上进行了测试: | 数据库 | 查询延迟(P50) | 查询延迟(P99) | 内存占用 | |--------|----------------|----------------|----------| | **Caliby** | **2.1ms** | **4.8ms** | **低** | | pgvector | 8.7ms | 21.3ms | 高 | | FAISS(内存模式) | 1.9ms | 3.2ms | 非常高 | | FAISS(磁盘模式) | 6.4ms | 15.7ms | 低 | > FAISS 内存模式确实更快,但需要将全部数据加载到 RAM 中。Caliby 在磁盘模式下实现了接近内存的速度。 --- ## 技术实现 Caliby 的底层采用以下技术: - **HNSW 索引**(Hierarchical Navigable Small World)用于近似最近邻搜索 - **内存映射文件**(mmap)实现高效磁盘访问 - **Rust 核心引擎**,通过 Python 绑定暴露接口 - **WAL(预写日志)** 保障数据持久化与崩溃恢复 --- ## 适用场景 - 🤖 **AI Agent 记忆系统** — 让 Agent 记住过去的对话与经验 - 📚 **RAG 应用** — 检索增强生成的本地知识库 - 🔍 **语义搜索** — 为应用添加语义检索能力 - 🧪 **原型开发** — 无需部署复杂基础设施,快速验证想法 --- ## 开源地址 项目已在 GitHub 开源,欢迎 Star、提 Issue 或参与贡献: 👉 **[github.com/caliby-db/caliby](https://github.com/caliby-db/caliby)** --- 我们很想听听大家的想法: - 你们目前在 AI 项目中使用什么向量数据库? - 有哪些功能是你们最迫切需要的? 欢迎在评论区留言交流!🙌

Reddit r/LocalLLaMA · 2026-05-09

Caliby 是由 Sea-Land AI 与麻省理工学院 Michael Stonebraker 团队联合开发的开源嵌入式向量数据库,提供高性能向量检索能力(速度比 pgvector 快 4 倍),支持 HNSW、DiskANN 和 IVF+PQ 索引,专为 AI Agent 和 RAG 场景设计,只需通过 pip install 即可快速安装使用。

0 人收藏 0 人点赞
#embeddings

AI 智能体记忆机制详解(28 分钟阅读)

TLDR AI · 2026-05-07 缓存

本文全面介绍了 AI 智能体记忆机制的技术原理,区分了工作记忆与长期记忆的实现方式,并探讨了上下文管理、基于嵌入的检索以及数据生命周期治理等关键策略。

0 人收藏 0 人点赞
#embeddings

TabEmbed:用于表格理解的通用嵌入的基准测试与学习

Hugging Face Daily Papers · 2026-05-06 缓存

本文介绍了 TabEmbed,这是一种用于表格数据的通用嵌入模型,统一了分类和检索任务,并介绍了 TabBench,这是一个用于评估表格理解能力的新基准。

0 人收藏 0 人点赞
#embeddings

来自 Gemini 的一点讽刺

Reddit r/singularity · 2026-04-23

用户在让 Google 的 Gemini 总结一篇关于 Google 新 Embedding 2 公告的博客文章后,注意到了其中的讽刺意味。

0 人收藏 0 人点赞
#embeddings

@_philschmid:Gemini Embedding 2 正式发布!一个能理解文本、图像、视频、音频和 PDF 的嵌入模型!5 种模态统一嵌入空间

X AI KOLs Following · 2026-04-22 缓存

Google 正式发布 Gemini Embedding 2,单一模型即可将文本、图像、视频、音频和 PDF 嵌入到统一空间,支持 100 多种语言,无需音频转录。

0 人收藏 0 人点赞
#embeddings

@jobergum:你们认识我是 BM25 guy,但 embeddings 也很酷。@HornetDev 团队刚刚发布了新文章,在 1 亿规模下做 ANN 调优……

X AI KOLs Timeline · 2026-04-22

HornetDev 团队发布文章,介绍在 1 亿级别数据下调优近似最近邻搜索,涵盖 embedding 偏差、图连通性与量化上限。

0 人收藏 0 人点赞
#embeddings

让教育数据可访问

OpenAI Blog · 2024-03-28 缓存

Zelma 是由布朗大学的 Emily Oster 博士及其团队与 Novy 合作开发的 GPT-4 驱动研究助手,它通过支持自然语言查询,使家长、教师、管理人员和政策制定者能够访问跨地区和人口统计的学生成绩标准化测试数据。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈