Launch HN: Parsewise (YC P25) – 通过API跨文档推理
摘要
Parsewise 是一个YC支持的API,可将非结构化文档转换为符合模式且具有可追溯来源的数据,实现跨文档的AI推理。
大家好,我们是 Parsewise 的创始人 Greg 和 Max<p>Parsewise 将一堆非结构化数据转换为符合模式的数据,并保留跨文档解析出的值的来源信息。
想象一下,给 Claude 一堆文件,要求输出 CSV 或 JSON。如果你尝试过,就会知道系统限制(文件数量、输入类型、成本、延迟),也面临着无法快速验证结果的人为挑战。我们解决了这两个问题。
我们帮助技术团队简化非结构化数据的 ETL,并让业务专家参与定义和即时验证。<p>这里是包含几个用例的视频:<a href="https://www.youtube.com/watch?v=dbRllnnh47w" rel="nofollow">https://www.youtube.com/watch?v=dbRllnnh47w</a><p>用一位用户的话来说 Parsewise:
“我需要从保险单 PDF、转录的电话、电子邮件等中提取信息。我不是在寻找那种逐数据点、逐页提取到结构化定义好的模式中的工具,而是需要更智能的、能理解信息可能分布在多个文档中,并能推理出需要提取什么内容的东西。”<p>我们创立公司的背景是十年在复杂数据转换和数据分析/综合方面的经验(和痛苦)。Greg 在 Palantir 构建过传统 ETL 并实施了 AI 工作流程。在贝恩,Max 在金融领域做过高度复杂的数据分析,这与我们许多客户类似。<p>Parsewise 的工作方式是接收一堆数据(比如几百或几千份 PDF、Excel 等),输出符合模式的数据,其中每个值都可追溯到桶内多个文档中的单词级别引用。我们为 API 客户提供在其应用程序中显示来源的方式,或者他们可以使用我们的平台进行内部操作。
数据处理的核心是自我改进的代理定义。它们定义了可接受的来源、解析或合并值的逻辑,以及向最终用户突出显示不确定性的规则。<p>底层技术是模型和云无关的,可以部署在私有网络中。我们在视觉推理方面使用 Gemini 模型取得了最佳结果,在我们找到的最强接地推理基准(Databricks OfficeQA)上达到了 SOTA(击败了 Claude Fable)[将包含我们博客文章的链接]。
值得注意的是,我们更专注于“人工控制”而非模型控制,注重我们在采用过程中看到的实际摩擦,即可验证性。这意味着优化信任结果所需的时间和点击次数。
我们使用 vLLM 进行解析,然后使用小模型进行高效的大规模穷举搜索。与 RAG 不同,我们不进行采样;而是穷举地找到给定查询的所有相关值。我们使用更大的模型进行有关解析的决策,并向用户标记不一致之处。<p>这种穷举性和显式值来源是我们平台的独特之处,它超越了现有许多提供商所涵盖的数据解析的第一步。<p>我们热烈欢迎构建者和爱好者尝试 Parsewise 来解决你们复杂的文档挑战。我们有很多关于如何扩展产品和改进的想法,也希望得到社区的反饋和想法!
查看缓存全文
缓存时间: 2026/07/01 13:59
# Launch HN: Parsewise (YC P25) – 使用API跨文档推理
来源:https://news.ycombinator.com/item?id=48746752
大家好,我们是Greg和Max,Parsewise的联合创始人
Parsewise能将一桶非结构化数据转换为符合模式的数据,同时保留跨文档解析出的值的溯源信息。想象一下,你给Claude一堆文件,要它输出CSV或JSON。如果你试过,就知道不仅存在系统限制(文件数量、输入类型、成本、延迟),还面临一个面向人类的挑战:无法快速验证结果。这两点我们都解决了。我们帮助技术团队简化非结构化数据的ETL流程,并让业务专家参与定义和即时验证。
这里有一段视频展示了一些用例:https://www.youtube.com/watch?v=dbRllnnh47w
用一位来找我们的人的话来说:Parsewise是“我需要从保险保单PDF、转录的电话录音、邮件等中提取信息。我不是要那种逐点逐页提取数据到结构化明确模式的东西,而是更智能代理化的方案——它能理解信息可能分散在不同文档中,并能推理应该提取什么。”
我们创办这家公司,基于我们在复杂数据转换和数据分析/综合方面十年的经验(和痛苦)。Greg曾在Palantir构建经典的ETL并实现AI工作流。Max在贝恩咨询公司从事金融领域高度复杂的数据分析,与我们的许多客户类似。
Parsewise的工作原理是:输入一桶数据(比如成百上千个PDF、Excel等),输出符合模式的数据,其中每个值都能追溯到桶内多个文档中的单词级引用。我们为API客户提供在其自有应用中展示溯源的方式,或者他们可以使用我们的平台进行内部操作。数据处理的核心是自改进的智能代理定义。它们定义了可接受的来源、解析或合并值的逻辑,以及向最终用户突出显示不确定性的规则。
底层技术是模型和云无关的,可以部署在私有网络中。我们在视觉推理方面使用Gemini模型取得了最佳效果,在我们找到的最强接地推理基准(Databricks OfficeQA)上达到了SOTA(击败了Claude Fable)[将包含我们博客文章的链接]。值得注意的是,我们更关注“人的约束”而非“模型的约束”,侧重于我们在实际采用中看到的摩擦——即可验证性。这意味着优化信任结果所需的时间和点击次数。我们使用视觉大语言模型进行解析,然后使用小模型进行高效的大规模穷举搜索。与RAG不同,我们不抽样,而是穷举地找到给定查询的所有相关值。我们使用更大的模型进行关于解析的决策,并向用户标记不一致。
这种穷举性和显式值溯源是我们平台独有的,它超越了现有许多提供商所涵盖的数据解析的第一步。
我们欢迎建设者和爱好者尝试Parsewise,解决你们复杂的文档挑战。我们有大量关于如何扩展产品和使其更好的想法,但希望能得到社区的反馈和意见!
相似文章
Parsewise API
Parsewise 是一个用于智能体多文档处理的 API,能够高效处理多个文档。
@jerryjliu0: LiteParse 是为 AI 智能体设计的最佳开源、无模型文档解析器。支持解析 50 多种文档类型,并…
LlamaIndex 发布了 liteparse-server,这是一个可自托管、无模型的 HTTP API,能够以高空间保真度和隐私保护能力解析多种多样的文档类型。
@jerryjliu0:完全解决文档解析包括覆盖准确性、成本和延迟的帕累托曲线上的每一个点:高…
Jerry Liu 提出了一个涵盖准确性、成本和延迟权衡的文档解析框架,介绍了 LiteParse 作为一个面向 AI 智能体循环的开源低延迟解析工具,以及 LlamaParse 用于高精度模式。
@tom_doerr: 将文档和媒体转换为用于LLM的结构化JSON https://github.com/adithya-s-k/omniparse…
OmniParse是一个本地平台,能够接收和解析非结构化数据(文档、图像、视频、音频、Web),并将其转换为针对LLM应用(如RAG和微调)优化的结构化JSON。
@jerryjliu0:我们当前的核心使命是利用 AI 解决文档 OCR 问题。我们所有的产品线,从商业产品(LlamaParse)到……
LlamaIndex 对其官网进行了全面改版,并重申了以 AI 驱动文档 OCR 的核心使命,旗下产品涵盖商业产品 LlamaParse 以及开源工具 LiteParse 和 ParseBench。LlamaParse 采用基于 VLM 的智能文档理解技术,可大规模处理复杂版式、表格、图表及手写文字。