@cevenif: 传统 RAG 的玩法正在被一个叫 PageIndex 的工具直接掀翻。它不用向量数据库、不用嵌入、不用切块,连相似搜索都省了,而是直接给文档建树形索引,让 LLM 像人一样逐层往下推。 在 FinanceBench 上,它跑出了 98.7…
摘要
PageIndex 是一个开源工具,通过构建文档的树形索引,无需向量数据库和嵌入,实现高效的 LLM 检索。在 FinanceBench 上达到 98.7% 的准确率。
查看缓存全文
缓存时间: 2026/06/17 22:03
传统 RAG 的玩法正在被一个叫 PageIndex 的工具直接掀翻。它不用向量数据库、不用嵌入、不用切块,连相似搜索都省了,而是直接给文档建树形索引,让 LLM 像人一样逐层往下推。
在 FinanceBench 上,它跑出了 98.7% 的准确率,把现有向量方案甩在身后。项目本身是开源的,做文档分析、AI 检索的可以盯一下。
https://chat.pageindex.ai
PageIndex Chat
Source: https://chat.pageindex.ai/ PDF758Pages
Pattern Recognition and Machine Learning
This document is a comprehensive textbook on pattern recognition and machine learning, covering foundational concepts, various models including linear, kernel, neural network, graphical, mixture, sampling, and sequential models, along with approximate inference techniques and appendices on mathematical topics.
How does Bayesian inference prevent overfitting?
Which page introduces the EM algorithm?
相似文章
@0x0SojalSec:无向量、基于推理的RAG的文档索引——无需向量数据库构建RAG。该开源库使用文档树...
PageIndex 是一个用于无向量、基于推理的RAG的开源库,它使用层次化文档树而非嵌入向量,在FinanceBench上达到了98.7%的准确率。它无需向量数据库或分块即可实现上下文感知检索。
@lidangzzz: 我去年就跟你们说,用RAG和vector database一定是死路一条。正确做法是, 1. 正确用好memory; 2. 正确把内容分块,做好indexing,做好summarization; 3. 正确给agent提供search工具…
作者批评RAG和向量数据库的方法,提出正确的做法包括用好memory、分块和索引、摘要、为agent提供搜索工具,以及使用SRAM-only推理服务如Groq和Cerebras。
@freeman1266: 普通 RAG vs 知识图谱 RAG vs LLM Wiki——三种知识库检索方案,95% 的人选错了,不是因为不懂,是因为没认清自己的数据形态。 三句话讲清楚: 普通 RAG:把文档切成 chunk,向量化入库,问题来了找相似片段喂给 …
本文对比了普通RAG、知识图谱RAG和LLM Wiki三种知识库检索方案的适用场景与选型建议,强调根据数据形态选择正确方案,避免盲目使用复杂工具。
@Marco_Ramilli: PageIndex 32,751 星 放弃向量数据库,停止分块。构建基于推理的 RAG,实现上下文感知、类人的……
PageIndex 是一个开源的、基于推理的 RAG 系统,它用层级树索引和 LLM 驱动的检索取代了向量数据库和分块,用于上下文感知、类人的文档理解。
@IndieDevHailey: Crawl4AI:7万星开源神器,把网页秒变LLM能吃的干净Markdown! 再见付费爬虫!零API Key,几秒出结构化数据,专为RAG、Agent、数据管道而生。 超干净输出:智能去噪、表格/代码/引用全保留,LLM直接喂 真快:异…
Crawl4AI 是一个开源的网页爬虫工具,能将网页内容转换为干净的 Markdown 格式,专为 LLM 的 RAG、Agent 和数据管道设计。零 API Key,快速输出结构化数据。
