embeddings

标签

Cards List
#embeddings

我为AI编码代理构建了一个开源持久记忆层

Reddit r/AI_Agents · 2026-06-09

一个为AI编码代理设计的开源持久记忆层,使用Postgres和pgvector存储和检索项目决策与上下文,旨在减少上下文窗口大小并提高代理的一致性。

0 人收藏 0 人点赞
#embeddings

使用Harrier嵌入向量的OpenClaw代理本地语义记忆搜索

Reddit r/openclaw · 2026-06-06

本文介绍了一种实用方法,利用微软的Harrier嵌入模型为OpenClaw代理提供本地语义记忆搜索功能,无需外部服务即可高效检索相关文本片段。

0 人收藏 0 人点赞
#embeddings

超越标记:基于LLM的多智能体系统中潜在通信的统一框架

arXiv cs.CL · 2026-06-05 缓存

本文提出了一个基于LLM的多智能体系统中潜在通信的统一框架,按照通信信息内容、发送者-接收者对位和融合技术对方法进行分类,并回顾了2024至2026年间的十八种代表性方法。

0 人收藏 0 人点赞
#embeddings

FAISS内部:十亿级相似性搜索

Hacker News Top · 2026-06-04 缓存

教育性文章,解释FAISS(一个用于十亿级相似性搜索的库),涵盖向量嵌入、最近邻搜索以及IVF和Product Quantization等高效检索技术。

0 人收藏 0 人点赞
#embeddings

SEA-Embedding:面向东南亚的开放可复现文本嵌入

arXiv cs.CL · 2026-06-03 缓存

SEA-Embedding 提出了一个完全开放且可复现的东南亚语言文本嵌入流水线,仅使用公开数据训练,在 SEA-BED 基准测试上取得了最先进的结果。

0 人收藏 0 人点赞
#embeddings

@mixedbreadai:到如今,所有人都知道单向量嵌入模型对现代工作流极为有限。但它们包含更多…

X AI KOLs Following · 2026-06-02 缓存

单向量嵌入模型可用于提取稀疏潜在术语,而BM25可将这一词汇转化为强大的检索器。

0 人收藏 0 人点赞
#embeddings

文本到图像模型对文本编码器的依赖比你想象的要少

Hugging Face Daily Papers · 2026-06-02 缓存

本文证明,文本到图像的扩散Transformer模型主要依赖文本编码器中的标记合并和词序,而非完整的上下文嵌入,表明图像模型本身能够解码复杂的语言结构。

0 人收藏 0 人点赞
#embeddings

花了太长时间调试RAG,后来才意识到分块一直是问题所在

Reddit r/ArtificialInteligence · 2026-06-01

一位开发者回顾调试RAG系统的经历,发现固定大小分块会破坏句子边界,向量搜索无法处理精确标识符(用BM25解决),以及过时索引导致自信的错误答案。

0 人收藏 0 人点赞
#embeddings

通用嵌入与特定嵌入,哪种更好?非英语语言临床编码搜索的实证研究

arXiv cs.CL · 2026-06-01 缓存

本文研究了基于大型语言模型合成数据微调的紧凑型任务特定双编码器是否能在非英语语言的临床编码检索中超越通用嵌入,并在西班牙语基准测试CodiESP和DISTEMIST上取得了最先进的结果。

0 人收藏 0 人点赞
#embeddings

AI编程工具真的解决了结构化企业上下文问题,还是仅仅在干净的代码仓库上演示效果良好?

Reddit r/ArtificialInteligence · 2026-05-31

分析了企业级AI编程工具中被忽视的过时嵌入问题,干净的演示环境掩盖了仓库图谱漂移和技术债务积累的问题。

0 人收藏 0 人点赞
#embeddings

@josefchen:在arXiv上发布我们的新论文:我们训练了有史以来最大的多语言食品模型。410万食谱。7种语言。…

X AI KOLs Timeline · 2026-05-26 缓存

新的arXiv论文宣布了最大的多语言食品模型,该模型在7种语言的410万食谱上训练,包含1,790种食材,压缩至2MB。

0 人收藏 0 人点赞
#embeddings

利用多语言LLM嵌入发现词汇空缺

arXiv cs.CL · 2026-05-26 缓存

本文提出了一种数据驱动的框架,利用多语言LLM的嵌入来检测语言间的词汇空缺,在韩语-英语对中实现了高准确率。

0 人收藏 0 人点赞
#embeddings

NVIDIA的Nemotron Personas嵌入向量

Reddit r/LocalLLaMA · 2026-05-23

使用Qwen 0.6B为Nemotron-Personas数据集预计算的嵌入向量,通过网页演示实现对合成角色进行语义搜索和聚类。

0 人收藏 0 人点赞
#embeddings

@Tabbu_ai: https://x.com/Tabbu_ai/status/2058145123444347339

X AI KOLs Timeline · 2026-05-23 缓存

一篇教育性推文串,解释了理解和从头构建LLM架构的11个关键课程,涵盖token、嵌入、注意力、位置编码、数据质量和常见误解。

0 人收藏 0 人点赞
#embeddings

从三个生产网站测试的分块与嵌入数据。[P]

Reddit r/MachineLearning · 2026-05-23

在三个生产网站上测试了用于RAG检索的分块与嵌入,发现收益率分数(高/中块的比例)可以预测语料库质量和重排序效果。

0 人收藏 0 人点赞
#embeddings

大多AI记忆系统是无意间只增不减,而非有意为之。后果显而易见。

Reddit r/AI_Agents · 2026-05-22

本文批评AI记忆系统默认采用只增不减的机制,导致随时间推移产生冲突信号和知识管理不善,并质疑是否有人真正在解决这一问题,而不仅仅是依赖更好的嵌入技术。

0 人收藏 0 人点赞
#embeddings

用于Horn逻辑推理的高质量嵌入

arXiv cs.AI · 2026-05-22 缓存

本文介绍了使用三元组损失生成用于Horn逻辑推理的高质量嵌入的新方法,包括平衡训练样本生成和困难样本强调的技术,这些方法提高了下游逻辑推理的效率。

0 人收藏 0 人点赞
#embeddings

@garrytan: GBrain现在可以使用嵌入向量,通过'brainstorm'和'brainstorm with lsd mode (latera…'来为你寻找反主流观点。

X AI KOLs Following · 2026-05-20 缓存

OpenCollider的研究人员展示了上下文工程技术可以提高原创性,现在GBrain利用嵌入向量,通过其'brainstorm'和'brainstorm with lsd mode'功能帮助用户找到反主流想法。

0 人收藏 0 人点赞
#embeddings

使用知识图谱嵌入的自动化大数据质量评估

arXiv cs.LG · 2026-05-20

本文介绍了一种基于知识的方法,利用知识图谱嵌入,通过预测上下文表示与质量规则之间的缺失边来自动评估大数据质量,优于传统的匹配方法。

0 人收藏 0 人点赞
#embeddings

你的AI记忆的可信度分数是嵌入模型的外键,该模型可能在六个月后不复存在。

Reddit r/AI_Agents · 2026-05-19

关于AI记忆系统的一个关键观察:当模型被替换时,与嵌入模型绑定的可信度分数会失效,而由于嵌入向量发生变化,重新校准也变得毫无意义。作者质疑是否有人在不重建信任逻辑的情况下解决了这个问题。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈