Show HN: HelixDB – 基于对象存储的图数据库

Hacker News Top 工具

摘要

HelixDB 是一个用 Rust 构建的图-向量数据库,专为知识图谱和 AI 记忆设计,提供统一平台支持图、向量、键值、文档和关系型数据模型,并配有便于本地和云端部署的工具。

嘿,HN,距离我们发布 HelixDB(<a href="https://news.ycombinator.com/item?id=43975423">https://news.ycombinator.com/item?id=43975423</a>)已经过去一年多了,这是我和一个朋友在大学时开始的项目。它是一个基于对象存储构建的 OLTP 图数据库,原生支持向量搜索和全文搜索(FTS)。<p>为什么选择图、向量和 FTS?图数据库提供了自然的数据认知模型,向量能够实现对图中实体和关系的语义理解,而 FTS 则提供更精确的过滤。许多 AI 驱动的应用试图通过拼凑多个独立的系统来组合这些功能,但即便如此,也没有原生方式来执行跨所有系统的连接或查询。你仍然需要在应用层处理这些逻辑。<p>Helix 最初是一个图数据库,但我们在尝试构建 AI 记忆系统后转向了混合图/向量方案,这让我们深入研究了 GraphRAG 和 HybridRAG,而它们需要独立的图数据库和向量数据库。<p>我们清楚在产品的每个开发阶段,可扩展性都将是一个挑战,但过去一年我们的首要目标是通过本地部署来验证产品,并且最初只打算在单节点上运行。扩展图数据库仍然是一个困难且昂贵的问题,我们以后必须解决。 其他图数据库解决扩展问题的一些常见方法包括:在分布式机器上复制整个数据集(每个节点极其昂贵),或者对数据进行分片。<p>分片数据库高效且实惠,但图数据不像关系型数据库那样有明确的分区。例如,关系数据库的分片涉及拆分表。而对于图数据库,边可能会跨分区,遍历节点时跨多台机器跳转效率低下且计算成本高昂。<p>为追求高可用性和更高吞吐量而复制图数据库,会大幅增加数据库的运营成本,且垂直扩展的能力仍有上限。我们处理的工作负载需要为智能体存储海量数据,但任何时刻只需其中一小部分数据。因此,与其将整个图放入内存,不如将其全部存储在对象存储中,在需要时获取所需的部分。<p>智能体受益于更优质的上下文,而这来自更丰富、更优质的数据(更多的关系等)。通过使用 S3 作为持久化/数据层,图的大小或关系的数量将<em>不受限制</em>,我们可以通过水平扩展节点并缓存每个节点上相关子图来扩展吞吐量和请求处理能力。这样,热点数据的延迟极低,冷存储(S3)的写入 p99 约 100 毫秒,读取约 50 毫秒。此外,存储成本极为低廉。<p>HelixDB 当前支持的工作负载包括: - TB 级海量数据,智能体需要在此之上进行搜索和遍历 - 为那些图数据成本成为瓶颈的公司提供经济实惠的图存储 - 整合多个数据库,赋予 AI 智能体对公司数据的自主权,助力企业实现更高程度的自动化 - AI 记忆 - 企业知识库<p>我们目前正在开发自己的通用 AI 记忆层,它将使用 HelixDB 作为底层引擎并完全开源。此外,我们还在完成向量搜索的预过滤功能,允许你基于图中的关系、元数据和子图进行预过滤。最后,GA 云版本将在未来几周内推出。<p>如果你想在本地运行 Helix(无论是在磁盘上还是在内存中),可以在我们的 GitHub(<a href="https://github.com/HelixDB/helix-db" rel="nofollow">https://github.com/HelixDB/helix-db</a>)或文档(<a href="https://docs.helix-db.com/database/local-development">https://docs.helix-db.com/database/local-development</a>)中查找更多信息。如果你有兴趣使用我们的分布式云,请发送邮件至 [email protected]。<p>非常感谢!欢迎评论和反馈!
查看原文
查看缓存全文

缓存时间: 2026/06/10 17:45

网站 | 文档 | Discord | X/twitter

相似文章

HydraDB OSS

Product Hunt

HydraDB OSS 是一个专为AI应用设计的开源图数据库,通过利用对象存储,提供快速、低延迟的性能,且操作开销最小。

Helicone 允许用户直接向共享 ClickHouse 编写 SQL

Hacker News Top

Helicone 实现了一项名为 HQL 的功能,允许客户针对共享的 ClickHouse 数据库编写原始 SQL 查询。他们利用 ClickHouse 的行策略和自定义设置来实施多租户隔离,确保每个组织只能看到自己的数据。