Xberg:面向智能体的本地“读取任意文档”工具
摘要
Xberg 是一个本地内容智能框架(Rust 核心,MIT 许可),通过 MCP 服务器或 CLI 从 101 种文档格式中提取文本,重建阅读顺序和表格,并为上下文窗口分块——所有操作均在设备端完成,服务于 AI 智能体。
文档输入是智能体反复遇到的痛点:PDF、扫描图像、电子表格和电子邮件都需要不同的库,而大多数云提取器意味着要将文档发送到设备之外。Xberg 是一个内容智能框架(Rust 核心,MIT 许可),智能体可以将其作为 MCP 服务器或 CLI 调用。它从 101 种文档格式(以及代码/数据、音频/视频和 URL)中提取内容,以布局感知的方式重建阅读顺序和表格,并为上下文窗口分块,全部在本地完成,不会离开机器。它内置多个 OCR 引擎,可与最好的 Python 库媲美,并且在原生 PDF 上在质量和表格保真度方面领先。因此,智能体无需手动预处理,而是通过 extract / extract_batch 工具自行读取文档。可与任何 MCP 框架配合使用,并支持 Python / Node / CLI。仓库和 MCP 配置见评论。
相似文章
Xberg v1 发布
Xberg v1 作为 Kreuzberg 的继任者发布,是一个高性能内容智能框架,支持 101 种文档格式、367 种代码/数据类型、音视频转录和 URL 抓取,拥有纯 Rust 的 PDF 和 OCR 后端、多种语言绑定以及移动端/WASM 支持。
Kreuzberg (本地文档提取) 被重命名为 Xberg - 当前版本为长期支持版本
Kreuzberg,一个本地文档提取工具,被重命名为 Xberg,其当前版本处于长期支持(LTS)阶段。
@bibryam: https://x.com/bibryam/status/2084204574559056207
对新兴的基于 Markdown 的文件格式(AGENTS.md、SKILL.md、规格/计划/任务文件、记忆文件)的探索,这些格式构成一个“元代码层”,使编码代理能够直接从代码仓库中发现并应用项目知识,从而改变了意图转化为实现的方式。
Contextberg
Contextberg 能将你的工作转化为 AI 代理内存,并通过模型上下文协议(MCP)提供服务。
@tom_doerr: 在本地索引PDF和Markdown文件以进行语义搜索和AI增强。 https://github.com/joelhooks/pdf-brain…
此工具在本地对PDF和Markdown文件进行索引,用于语义搜索和AI增强,使用Ollama进行嵌入和LLM处理,并提供CLI和MCP服务器以便与AI助手集成。