标签
介绍ALEE,一个使用抽象意义表示生成具有受控语义偏移的英语极小对的框架,并将其翻译用于评估275+种语言的文本嵌入,揭示了跨语言语义表示中持续存在的差距。
本文介绍了一项关于使用人工智能通过自然语言查询查找仿真模型的实验研究,评估了数据表示、嵌入模型和检索策略,发现开源嵌入和重排序方法显著提高了性能。
提出了一种将图嵌入高维空间并搜索信息性二维视角的方法,这些视角优化了美学和可读性指标(例如边交叉和角分辨率),这得益于一种新颖的边交叉可微替代方法。引入了一个交互式系统DataFly,用于探索多个候选视角。
Supermemory 现在可以完全在你的本地机器上运行,支持任何模型或通过 Ollama 离线使用,并集成了 Claude Code、Cursor、Langchain 等工具。
RAGless 是一种语义检索系统,它将用户问题与预生成的问题变体进行匹配,适用于封闭域 FAQ,省去了标准 RAG 中的 LLM 生成步骤,从而提高了精确度。
本文系统评估了时间序列基础模型(如 Chronos-2 和 MOMENT)在电子鼻数据上进行气体识别和浓度预测的效果。研究发现,微调是必要的,并且将 TSFM 嵌入表示与专门模型融合可以提升性能。
关于一个为Claude构建的自托管持久记忆系统的详细概述,该系统使用MCP、SQL Server和本地嵌入,实现跨会话的叙事连续性和身份一致性。
一篇博客文章,解释了什么是图像嵌入、为什么需要它们以及它们是如何工作的,包含示例和代码演练。
本帖子描述了如何使用model2vec和UMAP将数千条Obsidian笔记绘制到三维语义嵌入空间中,以揭示隐藏的模式和思维盲点。
本文研究了Word2Vec能否为仅含约130个词汇的人造语言Toki Pona生成有意义的语义嵌入,使用了一个包含140万句子的语料库,并考察了非Toki Pona标记对嵌入质量的影响。
本文提出使用超维计算(特别是全息简化表示)对表格数据行进行嵌入以实现结构化查询,从而获得可解释的相似性阈值和零匹配检测,在行检索任务上优于基线方法。
描述了构建一个网络爬虫,从酒店网站提取内容,使用AI智能体生成结构化的常见问题,并将其存储在向量数据库中,实现知识库的自动创建。
这条推文分享了一篇关于LLMs内部工作原理的详尽解释,涵盖了tokens、embeddings、positional encoding、attention和feed-forward网络,来源于0xkato的一篇博文。
Oracle 的 AI 数据库现在包含了用于基于嵌入的图像搜索的向量存储功能,展示了创新特性,使其成为一个统一的数据存储解决方案。
描述了一种改进智能体记忆搜索的方法:受一篇论文启发,将基于 grep 的精确匹配与向量嵌入相结合;在其记忆层中实现了显著的召回率提升。
该研究揭示了LLM文本嵌入被高频token(如句号、冠词)绑架的问题,提出EmbedFilter方法通过对unembedding矩阵进行SVD分解并减去投影分量来释放真实语义,实现零训练开销的降维和检索效率提升。
Phoenix Grove AI推出了Memory Constellations,这是一种AI记忆嵌入的3D可视化,展示了数据点之间的关系并随时间演变。
一份关于为AI智能体优化知识图谱摄入的详细指南,提出了一个五步流水线(提取、解析、嵌入、去重、路由),以防止图谱损坏并提高检索质量。
本文探究语言模型是否在其嵌入空间中编码了结构化的、人类可解读的意识谱,表明句子形成了从低到高状态的可导航流形,对模型引导与对齐具有启示意义。
本文介绍了一种轻量级方法,利用Chronos-2时间序列基础模型的冻结嵌入,结合一个简单的回归头,进行剩余使用寿命估计,在工业传感器数据上相比基线方法取得了更优的性能。