Xberg:面向智能体的本地“读取任意文档”工具

Reddit r/AI_Agents 工具

摘要

Xberg 是一个本地内容智能框架(Rust 核心,MIT 许可),通过 MCP 服务器或 CLI 从 101 种文档格式中提取文本,重建阅读顺序和表格,并为上下文窗口分块——所有操作均在设备端完成,服务于 AI 智能体。

文档输入是智能体反复遇到的痛点:PDF、扫描图像、电子表格和电子邮件都需要不同的库,而大多数云提取器意味着要将文档发送到设备之外。Xberg 是一个内容智能框架(Rust 核心,MIT 许可),智能体可以将其作为 MCP 服务器或 CLI 调用。它从 101 种文档格式(以及代码/数据、音频/视频和 URL)中提取内容,以布局感知的方式重建阅读顺序和表格,并为上下文窗口分块,全部在本地完成,不会离开机器。它内置多个 OCR 引擎,可与最好的 Python 库媲美,并且在原生 PDF 上在质量和表格保真度方面领先。因此,智能体无需手动预处理,而是通过 extract / extract_batch 工具自行读取文档。可与任何 MCP 框架配合使用,并支持 Python / Node / CLI。仓库和 MCP 配置见评论。
查看原文

相似文章

Xberg v1 发布

Reddit r/LocalLLaMA

Xberg v1 作为 Kreuzberg 的继任者发布,是一个高性能内容智能框架,支持 101 种文档格式、367 种代码/数据类型、音视频转录和 URL 抓取,拥有纯 Rust 的 PDF 和 OCR 后端、多种语言绑定以及移动端/WASM 支持。

@bibryam: https://x.com/bibryam/status/2084204574559056207

X AI KOLs Timeline

对新兴的基于 Markdown 的文件格式(AGENTS.md、SKILL.md、规格/计划/任务文件、记忆文件)的探索,这些格式构成一个“元代码层”,使编码代理能够直接从代码仓库中发现并应用项目知识,从而改变了意图转化为实现的方式。

Contextberg

Product Hunt

Contextberg 能将你的工作转化为 AI 代理内存,并通过模型上下文协议(MCP)提供服务。