@huang_chao4969: LightRAG v1.5 来了!史上最大更新!35k+ GitHub | 1.1M+ 下载量 | 251 位贡献者 | 1.1k+ PR 已合并…

X AI KOLs Timeline 工具

摘要

LightRAG v1.5 已发布,带来六大重大改进,包括多模态文档处理、增强的解析功能以及角色特定的 LLM 配置,使 RAG 更简单、更快速、更强大。

LightRAG v1.5 来了!史上最大更新! 35k+ GitHub | 1.1M+ 下载量 | 251 位贡献者 | 1.1k+ PR 已合并 以下是六大改进: • 多模态文档处理 - 对图像、表格和公式进行全面的索引和问答 • 增强的文档解析 - 集成 MinerU 和 Docling,并支持原生 DOCX 解析 • 四种文本分块策略 - 固定/递归/语义向量/段落语义 • 角色特定的 LLM 配置 - 为 EXTRACT、QUERY、KEYWORDS、VLM 角色提供独立模型 • 增强的结构化抽取 - JSON 输出和外部化实体类型提示 • 任务感知嵌入 - 原生支持非对称模型,如 voyage-3 和 text-embedding-004 使 RAG 更简单、更快速、更强大! GitHub: https://github.com/HKUDS/LightRAG
查看原文
查看缓存全文

缓存时间: 2026/05/24 00:18

LightRAG v1.5 来了!迄今为止最大版本!35k+ GitHub 星星 | 110万+ 下载量 | 251 位贡献者 | 1100+ 合并 PR 六大主要改进如下:

• 多模态文档处理 – 支持图片、表格和公式的全面索引与问答 • 增强文档解析 – 集成 MinerU 和 Docling,并原生支持 DOCX 解析 • 四种文本分块策略 – 固定 / 递归 / 语义向量 / 段落语义 • 角色专属 LLM 配置 – 为 EXTRACT / QUERY / KEYWORDS / VLM 角色提供独立模型设置 • 增强结构化提取 – JSON 输出和外部实体类型提示 • 任务感知 Embedding – 原生支持 voyage-3 和 text-embedding-004 等非对称模型

让 RAG 更简单、更快、更强大! GitHub: https://github.com/HKUDS/LightRAG


HKUDS/LightRAG 来源:https://github.com/HKUDS/LightRAG

🚀 LightRAG:简单快速的检索增强生成



🎉 新闻

  • [2026.05]🎯[新功能]:将 RagAnything 合并到 LightRAG🎉。通过 MinerU / Docling 服务实现多模态内容解析和提取。
  • [2026.05]🎯[新功能]:引入四种可选的文本分块策略:FixRecursiveVectorParagraph
  • [2026.05]🎯[新功能]:支持角色专属 LLM 配置,共 4 个不同角色:EXTRACT、QUERY、KEYWORDS 和 VLM,可独立设置 LLM 参数。
  • [2026.03]🎯[新功能]:集成 OpenSearch 作为统一存储后端,全面支持 LightRAG 的所有四种存储方式。
  • [2026.03]🎯[新功能]:引入设置向导。支持通过 Docker 本地部署 embedding、reranking 和存储后端。
  • [2025.11]🎯[新功能]:集成 RAGAS 评估Langfuse 追踪。更新 API,在查询结果中返回检索上下文以支持上下文精确度指标。
  • [2025.10]🎯[可扩展性增强]:消除处理瓶颈,有效支持大规模数据集
  • [2025.09]🎯[新功能]:提升开源 LLM(如 Qwen3-30B-A3B)的知识图谱提取准确度。
  • [2025.08]🎯[新功能]:现已支持 Reranker,显著提升混合查询性能(设置为默认查询模式)。
  • [2025.08]🎯[新功能]:新增文档删除功能,自动重建知识图谱以确保最佳查询性能。
  • [2025.06]🎯[新发布]:团队发布了 RAG-Anything (https://github.com/HKUDS/RAG-Anything) —— 一个全合一多模态 RAG 系统,可无缝处理文本、图片、表格和公式。
  • [2025.06]🎯[新功能]:LightRAG 现已通过 RAG-Anything (https://github.com/HKUDS/RAG-Anything) 集成全面支持多模态数据处理,能对 PDF、图片、Office 文档、表格和公式等多种格式进行无缝文档解析和 RAG 能力。详情请参阅新的多模态章节 (https://github.com/HKUDS/LightRAG/?tab=readme-ov-file#multimodal-document-processing-rag-anything-integration)。
  • [2025.03]🎯[新功能]:LightRAG 现支持引用功能,可实现正确的源归属和增强的文档可追溯性。
  • [2025.02]🎯[新功能]:现在可以使用 MongoDB 作为统一存储解决方案进行数据管理。
  • [2025.02]🎯[新发布]:团队发布了 VideoRAG (https://github.com/HKUDS/VideoRAG) —— 一个用于理解超长视频的 RAG 系统。
  • [2025.01]🎯[新发布]:团队发布了 MiniRAG (https://github.com/HKUDS/MiniRAG),让使用小模型的 RAG 更简单。
  • [2025.01]🎯现在可以使用 PostgreSQL 作为数据管理的统一存储解决方案。
  • [2024.11]🎯[新资源]:LearnOpenCV (https://learnopencv.com/lightrag) 上现已提供 LightRAG 综合指南。深入探索教程和最佳实践。非常感谢博客作者们的杰出贡献!
  • [2024.11]🎯[新功能]:推出 LightRAG WebUI —— 一个直观的网页仪表盘,允许您插入、查询和可视化 LightRAG 知识。
  • [2024.11]🎯[新功能]:现在可以使用 Neo4J 存储 (https://github.com/HKUDS/LightRAG?tab=readme-ov-file#using-neo4j-for-storage) —— 支持图数据库。
  • [2024.10]🎯[新功能]:我们添加了一个 LightRAG 介绍视频 (https://youtu.be/oageL-1I0GE) 的链接 —— 对 LightRAG 功能的全面演示。感谢作者的杰出贡献!
  • [2024.10]🎯[新频道]:我们创建了一个 Discord 频道 (https://discord.gg/yF2MmDJyGJ)!💬 欢迎加入我们的社区,分享、讨论和协作!

🎉🎉 算法流程图

LightRAG 索引流程图 图 1: LightRAG 索引流程图 - 图片说明:来源 (https://learnopencv.com/lightrag/)

LightRAG 检索和查询流程图 图 2: LightRAG 检索和查询流程图 - 图片说明:来源 (https://learnopencv.com/lightrag/)

安装

💡 使用 uv 进行包管理:本项目使用 uv (https://docs.astral.sh/uv/) 实现快速可靠的 Python 包管理。请先安装 uv: curl -LsSf https://astral.sh/uv/install.sh | sh (Unix/macOS) 或 powershell -c "irm https://astral.sh/uv/install.ps1 | iex" (Windows)

注意:如果您更偏好 pip,也可以使用,但建议使用 uv 以获得更好的性能和更可靠的依赖管理。

📦 离线部署:对于离线或隔离环境,请参阅 离线部署指南 了解预安装所有依赖和缓存文件的说明。

安装 LightRAG Server

LightRAG Server 旨在提供 Web UI 和 API 支持。Web UI 便于文档索引、知识图谱探索以及简单的 RAG 查询界面。LightRAG Server 还提供兼容 Ollama 的接口,旨在将 LightRAG 模拟为 Ollama 聊天模型。这使得诸如 Open WebUI 等 AI 聊天机器人能够轻松访问 LightRAG。

  • 从 PyPI 安装
### 使用 uv 将 LightRAG Server 安装为工具(推荐)
uv tool install "lightrag-hku[api]"

### 或使用 pip
# python -m venv .venv
# source .venv/bin/activate
# Windows: .venv\Scripts\activate
# pip install "lightrag-hku[api]"

### 构建前端项目
cd lightrag_webui
bun install --frozen-lockfile
bun run build
cd ..

# 设置环境文件
# 通过从 GitHub 仓库根目录下载或从本地源码检出复制 env.example 文件
cp env.example .env

# 使用您的 LLM 和 embedding 配置更新 .env

# 启动服务器
lightrag-server
  • 从源码安装
git clone https://github.com/HKUDS/LightRAG.git
cd LightRAG

# 引导开发环境(推荐)
make dev
source .venv/bin/activate  # 激活虚拟环境 (Linux/macOS)
# 或 Windows: .venv\Scripts\activate

# make dev 会安装测试工具链和完整的离线堆栈
#(API、存储后端以及提供者集成),然后构建前端。
# 在启动服务器前,请运行 make env-base 或复制 env.example 到 .env。

# 使用 uv 的等效手动步骤
# 注意:uv sync 会在 .venv/ 中自动创建虚拟环境
uv sync --extra test --extra offline
source .venv/bin/activate  # 激活虚拟环境 (Linux/macOS)
# 或 Windows: .venv\Scripts\activate

### 或使用带虚拟环境的 pip
# python -m venv .venv
# source .venv/bin/activate
# Windows: .venv\Scripts\activate
# pip install -e ".[test,offline]"

# 构建前端项目
cd lightrag_webui
bun install --frozen-lockfile
bun run build
cd ..

# 设置环境文件
make env-base
# 或:cp env.example .env 并手动更新

# 启动 API-WebUI 服务器
lightrag-server
  • 使用 Docker Compose 启动 LightRAG Server
git clone https://github.com/HKUDS/LightRAG.git
cd LightRAG
cp env.example .env
# 使用您的 LLM 和 embedding 配置更新 .env
# 修改 .env 中的 LLM 和 Embedding 设置
docker compose up

LightRAG Docker 镜像的历史版本可在此处找到:LightRAG Docker Images

官方 GHCR 镜像由 GitHub Actions 使用 GitHub OIDC 通过 Sigstore Cosign 签名。验证命令请参见 docs/DockerDeployment.md

使用设置工具创建 .env 文件

无需手动编辑 env.example,使用交互式设置向导生成配置好的 .env,并在需要时生成 docker-compose.final.yml

make env-base          # 必需的第一步:LLM、embedding、reranker
make env-storage       # 可选:存储后端和数据库服务
make env-server        # 可选:服务器端口、认证和 SSL
make env-base-rewrite  # 可选:强制重新生成向导管理的 compose 服务
make env-storage-rewrite # 可选:强制重新生成向导管理的 compose 服务
make env-security-check # 可选:审计当前 .env 的安全性风险

每个目标的完整描述请参见 docs/InteractiveSetup.md。设置向导仅更新配置;在部署前,请单独运行 make env-security-check 审计当前 .env 的安全性风险。默认情况下,重新运行设置会保留未更改的向导管理 compose 服务块;仅当需要从捆绑模板重新构建这些管理块时,才使用 *-rewrite 目标。

安装 LightRAG Core

  • 从源码安装(推荐)
cd LightRAG
# 注意:uv sync 会在 .venv/ 中自动创建虚拟环境
uv sync
source .venv/bin/activate  # 激活虚拟环境 (Linux/macOS)
# 或 Windows: .venv\Scripts\activate
# 或:pip install -e .
  • 从 PyPI 安装
uv pip install lightrag-hku
# 或:pip install lightrag-hku

快速开始

对 LLM 和技术栈的要求

LightRAG 对大型语言模型(LLM)能力的要求显著高于传统 RAG,因为它需要 LLM 执行文档中的实体-关系提取任务。配置合适的 Embedding 和 Reranker 模型对于提高查询性能也至关重要。

  • LLM 选择
    • 建议使用至少 32B 参数的 LLM。
    • 上下文长度至少应为 32KB,推荐 64KB。
    • 不建议在文档索引阶段选用推理模型。
    • 在查询阶段,建议选择比索引阶段能力更强的模型以获得更好的查询结果。
  • Embedding 模型
    • 高性能 Embedding 模型对 RAG 至关重要。
    • 我们推荐使用主流多语言 Embedding 模型,例如:BAAI/bge-m3text-embedding-3-large
    • 重要提示:Embedding 模型必须在文档索引前确定,并且在文档查询阶段需要使用同一模型。对于某些存储方案(例如 PostgreSQL),向量维度必须在首次创建表时定义。因此,在更改 embedding 模型时,需要删除现有向量相关表,并让 LightRAG 用新维度重新创建它们。
  • Reranker 模型配置
    • 配置 Reranker 模型可以显著提升 LightRAG 的检索性能。
    • 启用 Reranker 模型后,建议将“混合模式”设置为默认查询模式。
    • 我们推荐使用主流 Reranker 模型,例如:BAAI/bge-reranker-v2-m3 或 Jina 等服务提供的模型。

LightRAG Server 快速开始

LightRAG Server 旨在提供 Web UI 和 API 支持。它提供全面的知识图谱可视化功能,支持多种力导向布局、节点查询、子图过滤等。更多关于 LightRAG Server 的信息,请参阅 LightRAG Server

iShot_2025-03-23_12.40.08

LightRAG Core 快速开始

要开始使用 LightRAG Core,请参考 examples 文件夹中的示例代码。此外,还提供了一个视频演示 (https://www.youtube.com/watch?v=g21royNJ4fw) 来指导您完成本地设置。如果您已经拥有 OpenAI API 密钥,可以立即运行演示:

### 您必须在项目文件夹中运行演示代码
cd LightRAG

### 提供您的 OpenAI API-KEY
export OPENAI_API_KEY="sk-...your_opeai_key..."

### 下载查尔斯·狄更斯《圣诞颂歌》的演示文档
curl https://raw.githubusercontent.com/gusye1234/nano-graphrag/main/tests/mock_data.txt > ./book.txt

### 运行演示代码
python examples/lightrag_openai_demo.py

流式响应实现示例请参见 examples/lightrag_openai_compatible_demo.py。在执行之前,请确保根据实际情况修改示例代码中的 LLM 和 embedding 配置。

注意1:运行演示程序时,请注意不同测试脚本可能使用不同的 embedding 模型。如果切换到不同的 embedding 模型,必须清除数据目录(./dickens),否则程序可能出错。如果您希望保留 LLM 缓存,可以在清除数据目录时保留 kv_store_llm_response_cache.json 文件。

注意2:只有 lightrag_openai_demo.pylightrag_openai_compatible_demo.py 是官方支持的示例代码。其他示例文件是社区贡献的,未经全面测试和优化。

使用 LightRAG Core 编程

关于完整的 Core API 参考——包括初始化参数、QueryParam、LLM/embedding 提供者示例(OpenAI、Ollama、Azure、Gemini、HuggingFace、LlamaIndex)、reranker 注入、插入操作、实体/关系管理以及删除/合并——请参见 docs/ProgramingWithCore.md

⚠️ 如果您想将 LightRAG 集成到您的项目中,我们建议使用 LightRAG Server 提供的 REST API。LightRAG Core 通常用于嵌入式应用或供研究人员进行研究和评估。

高级功能

LightRAG 提供了额外功能,包括 token 使用跟踪、知识图谱数据导出、LLM 缓存管理、Langfuse 可观测性集成以及基于 RAGAS 的评估。请参见 docs/AdvancedFeatures.md

多模态文档处理

LightRAG Server 包含一个多模态文档流水线,支持 PDF、Office 文档、图片、表格和公式。解析通过外部 MinerU 或 Docling 服务处理,而多模态索引在 LightRAG 流水线中运行。设置详情请参见 docs/AdvancedFeatures.md

重现论文中的发现

LightRAG 在农业、计算机科学、法律和混合领域上持续优于 NaiveRAG、RQ-RAG、HyDE 和 GraphRAG。完整的评估方法、提示词和复现步骤,请参见 docs/Reproduce.md

整体性能表

农业计算机科学法律混合
NaiveRAGLightRAGNaiveRAGLightRAGNaiveRAGLightRAGNaiveRAGLightRAG
全面性32.4%67.6%38.4%61.6%16.4%83.6%38.8%61.2%
多样性23.6%76.4%38.0%62.0%13.6%86.4%32.4%67.6%
赋能32.4%67.6%38.8%61.2%16.4%83.6%42.8%57.2%
整体32.4%67.6%38.8%61.2%15.2%84.8%40.0%60.0%
RQ-RAGLightRAGRQ-RAGLightRAGRQ-RAGLightRAGRQ-RAGLightRAG
全面性31.6%68.4%38.8%61.2%15.2%84.8%39.2%60.8%
多样性29.2%70.8%39.0%61.0%14.0%86.0%32.8%67.2%
赋能33.6%66.4%39.2%60.8%16.4%83.6%43.6%56.4%
整体31.2%68.8%39.6%60.4%14.8%85.2%40.0%60.0%

相似文章

HKUDS/RAG-Anything

GitHub Trending (daily)

HKUDS 发布 RAG-Anything:基于 LightRAG 的开源一站式多模态检索增强生成框架。

@ando_w: https://x.com/ando_w/status/2075468963098546520

X AI KOLs Timeline

本文介绍如何将单轮RAG升级为Agentic RAG,通过让LLM自主决定多次检索和调用工具,解决复合问题的多步推理。提供了基于Qwen3.7-Max的代码示例和实现思路。