semantica-agi/semantica
摘要
Semantica 是一个开源的、图原生(graph-native)基础设施平台,用于构建具备上下文感知和可问责性的 AI 系统。它能够摄取企业数据、构建知识/上下文图谱,并提供图分析、因果推理和端到端的决策溯源。
面向上下文与可问责 AI 系统的图原生基础设施
查看缓存全文
缓存时间: 2026/08/07 13:46
semantica-agi/semantica 来源:https://github.com/semantica-agi/semantica ### 面向上下文与可问责 AI 系统的图原生基础设施 #### AI 智能体的开源 Palantir > 摄取您的企业数据,提取关键信息,构建上下文图(Context Graph)和知识图谱(KG),并在其上运行图分析与因果推理,全程内置完整的决策溯源。天生可解释、可追踪、可信赖。 决策智能 · 上下文管理 · 确定性推理 · 本体管理 · 知识建模 · 端到端可追溯性 开源 · 可自托管 · 可审计 · 可治理 · 零供应商锁定 多语言图存储 · 支持 RDF 与 LPG · W3C 标准 · 可互操作 #### 为高影响、强监管领域而构建 GitHub Stars (https://github.com/semantica-agi/semantica) GitHub Forks (https://github.com/semantica-agi/semantica/network/members) Contributors (https://github.com/semantica-agi/semantica/graphs/contributors) PyPI (https://pypi.org/project/semantica/) Total Downloads (https://pepy.tech/project/semantica) Python 3.8+ (https://www.python.org/) License: MIT (https://opensource.org/licenses/MIT) CI (https://github.com/semantica-agi/semantica/actions) Ask DeepWiki (https://deepwiki.com/semantica-agi/semantica) Website (https://getsemantica.ai/) Docs (https://docs.getsemantica.ai/) Discord (https://discord.gg/sV34vps5hH) Twitter/X (https://x.com/BuildSemantica) YouTube (https://www.youtube.com/watch?v=QfnNZg4-dZA) 更新日志 bash pip install semantica — 知识探索器 · 上下文图 · 推理引擎 · 决策智能 · 本体中心 ▶ 观看完整平台演示 (https://www.youtube.com/watch?v=QfnNZg4-dZA) — 大多数 AI 智能体在行动时不留下任何轨迹。它们存储的是嵌入向量,而不是意义:无法解释的上下文、无法审计的决策。在信贷领域,这种差距是合规风险,而不是不便:一个承保智能体的批准必须在几个月后经受住监管机构“为什么”的追问。Semantica 位于您的 LLM、向量存储和智能体框架之下,作为一个确定性基础设施层:图构建、推理和溯源完全不需要 LLM。 适用人群: - AI/ML 平台团队:正在交付做出重大决策的智能体,需要从碎片化原始数据中构建结构化、可查询的上下文,而不仅仅是向量索引 - 基于 Databricks 或 Snowflake 的数据平台团队:需要将已经存在于 Unity Catalog 或 Snowflake 数仓中的表转换为受治理、带血缘追踪的知识图谱,而无需先将数据导出到第三方 SaaS - 合规、风险与审计团队:需要以监管机构真正接受的形式,对“AI 为什么这么做?”获得直接答案 - 受监管企业(金融、医疗、法律、政府、国防):不能交付黑盒,也不能将数据发送到其他厂商的 SaaS 来获得一个黑盒 - 平台与基础设施工程师:希望知识图谱、推理和溯源栈能够自托管且可替换,而不被锁定在单一厂商的后端上 - 数据与知识工程师:正在从杂乱的多源数据构建知识图谱:实体和关系被提取,冲突或矛盾的事实被标记出来而不是静默覆盖,重复数据在变成噪音之前被合并 快速开始 · 架构 · 您将获得什么 · 为什么选择 Semantica · 决策智能 · 上下文图 · 实战:审计追踪 · 模块参考 · 集成 · CLI · 性能 · 安装 — ## Semantica 带来的能力 - 上下文图: 一个结构化、可查询的图,涵盖您的智能体所知、所决策和所推理的一切 - 决策智能: 每个决策都是一等对象:可追溯、可按先例搜索、可因果关联 - AI 治理与本体: SHACL 约束、冲突检测、合规规则、OWL 生成,以及带可视化编辑器的 SKOS 词汇表管理 - 完全可审计: 每个事实都带有 W3C PROV-O 溯源,审计轨迹可导出为 JSON、CSV 或 RDF - 确定性推理: 前向链、Rete 网络、Datalog 和 SPARQL,全程可解释,而非黑盒 - 知识管道: 多源摄取、实体感知分块、NER/关系/事件抽取、知识图谱构建,全程进行语义去重和保留溯源的合并 - 企业数据平台: 原生连接器支持 Databricks(Unity Catalog + Delta Lake,PAT/OAuth M2M 认证,catalog/schema/table/lineage 元数据探测)和 Snowflake(warehouse/database/schema,密钥对和 OAuth 认证),让已经存在于 lakehouse 或数仓中的表直接成为带溯源信息的图节点,而不是又一次导出/导入的跳跃 - 图分析: 对刚构建的图执行中心性、社区发现、链接预测和最短路径查询 - 多语言图存储: 原生 RDF(嵌入式 Oxigraph、Blazegraph、Apache Jena、Eclipse RDF4J,通过 SPARQL)和标签属性图(Neo4j、FalkorDB、Apache AGE、AWS Neptune,通过 Cypher),以及向量存储,全部可替换而不影响您的代码 - 可视化: 在交互式浏览器工作台中探索任意图、本体或时间线 - 即插即用集成: 原生 Agno 支持、功能完备的 MCP 服务器、全面的 CLI、REST API,以及覆盖主流编辑器的插件 — ## 为什么选择 Semantica | | 向量数据库 + RAG | 纯 LLM 记忆 | Semantica | | — | — | — | — | | 召回方式 | 嵌入向量相似度 | 上下文窗口 | 图遍历 + 语义搜索 | | 决策历史 | 不存储 | 不存储 | 一等可查询对象 | | 溯源 | 无 | 无 | W3C PROV-O,关联来源 | | 推理 | 无 | 黑盒 | 前向链、Rete、Datalog、SPARQL | | 冲突检测 | 静默覆盖 | 静默覆盖 | 检测、标记、解决 | | 时间旅行 | 不支持 | 不支持 | 任意时点图快照 | | 合规导出 | 无 | 无 | PROV-O、SHACL、OWL、RDF | | 策略执行 | 无 | 无 | 内置规则引擎 + SHACL | | 实体解析 | 不支持 | 不支持 | 阻塞 + 语义去重 | | 多智能体上下文 | 每个智能体独立 | 每个智能体独立 | 单一共享智能层 | Semantica 是对您现有技术栈的补充,而非替代。保留您的 LLM、向量存储和智能体框架不变;Semantica 在其之上增加决策记录、因果推理、溯源、本体治理、冲突检测和审计追踪。推理引擎、知识图谱构建和溯源层完全确定性,使用它们不需要 LLM。 — ## 快速开始 bash pip install semantica python from semantica.context import ContextGraph graph = ContextGraph(advanced_analytics=True) # 每个智能体决策都成为可查询、可审计的知识节点 decision_id = graph.record_decision( category="vendor_selection", scenario="Choose cloud provider for HIPAA workload", reasoning="AWS offers BAA, mature HIPAA tooling, and existing team expertise", outcome="selected_aws", confidence=0.93, ) # 询问“为什么发生这件事?”并获得真实、结构化的答案 chain = graph.trace_decision_chain(decision_id) # 完整因果祖先 similar = graph.find_similar_decisions("cloud vendor", max_results=5) # 先例 impact = graph.analyze_decision_impact(decision_id) # 下游影响图 compliant = graph.check_decision_rules({"category": "vendor_selection"}) # 策略门禁 5 秒内验证安装: bash semantica doctor # Python 3.11.9 pass # semantica 0.6.0 pass # faiss vector store pass # Config file pass ~/.semantica/config.yaml 如果 Semantica 为您解决了实际问题,一个 star 能帮助更多人发现它。 ⭐ 在 GitHub 上点赞 (https://github.com/semantica-agi/semantica) · 加入 Discord (https://discord.gg/sV34vps5hH) — ## 架构 Semantica 是一个真正的端到端管道,而不是一个顶着营销名称的单一库。下方每个阶段都是独立可导入的发布模块: 数据源 → 摄取 → 解析 → 规范化 → 切分 → 抽取 → 冲突检测 → 去重 → 知识图谱 → [ 本体 · 推理 · 溯源 · 决策 ] → 增强知识图谱 → 向量存储 + 多语言图存储(RDF 与 LPG) → 导出 / 可视化 / REST · MCP · CLI - 摄取: 文件、网页、数据库、企业数据平台(Databricks、Snowflake)、云(Google Drive、Elasticsearch)、流(Kafka、Kinesis)、Git、电子邮件、MCP - 解析 → 规范化 → 切分: 文档解析、文本/实体/日期规范化、面向 GraphRAG 的实体感知分块 - 抽取 → 冲突检测 → 去重: NER、关系、事件、三元组;冲突事实在合并前被标记并解决 - 知识图谱: GraphBuilder 构建图;双时态事实和完整图分析(中心性、社区、链接预测)在其上运行 - 本体 · 推理 · 溯源 · 决策: 位于知识图谱之上的智能层,提供 SHACL/OWL 治理、Rete/Datalog/SPARQL 推理、W3C PROV-O 血缘以及一等决策记录 - 存储: 天生多语言,支持 RDF 三元组库(嵌入式 Oxigraph、Blazegraph、Apache Jena、Eclipse RDF4J)、标签属性图(Neo4j、FalkorDB、Apache AGE、AWS Neptune)以及向量存储,全部可替换而不影响您的代码 - 输出: 导出(RDF、OWL、Parquet、Cypher、JSON-LD)、交互式可视化,以及通过 REST API、MCP 服务器或 CLI 访问 → 管道和决策智能生命周期的完整 Mermaid 图 — ## 决策智能 决策智能将每一个 AI 选择从短暂的推理转变为永久、可审计、可查询的记录。它回答*“您的 AI 决定了什么、为什么以及接下来发生了什么?”——这是监管机构和企业风险团队日益迫切提出的问题。在 Semantica 中,决策不是一行日志,而是一个具有完整生命周期的一等图节点。在受监管领域,每个 AI 决策都必须可追溯到来源,并能向审计人员自证:record_decision() 创建一条永久、结构化的记录,可导出为 W3C PROV-O——这是大多数合规框架接受用于监管提交的格式。 record_decision() → 作为带有完整结构化上下文的图节点存储 add_causal_relationship() → 关联到上游原因和下游影响 find_similar_decisions() → 跨所有历史决策进行语义先例搜索 trace_decision_chain() → 完整因果祖先,回溯至根本原因 analyze_decision_impact() → 下游影响图 - 此决策影响的一切 check_decision_rules() → 针对可配置规则集的策略合规门禁 export / audit trail → W3C PROV-O、CSV 或 JSON,用于监管提交 python from semantica.context import ContextGraph graph = ContextGraph(advanced_analytics=True) # 记录带有完整结构化上下文的决策 app_id = graph.record_decision( category="credit_application", scenario="Personal loan, $85k income, 31% DTI, 3yr employment", reasoning="Income meets threshold; employment stable; no adverse credit events", outcome="proceed_to_underwriting", confidence=0.88, metadata={"applicant_id": "A-7291"}, ) uw_id = graph.record_decision( category="loan_underwriting", scenario="Underwriting review for A-7291", reasoning="DTI within policy; clean 36-month credit history", outcome="approved", confidence=0.94, ) rate_id = graph.record_decision( category="interest_rate", scenario="Rate assignment for approved loan A-7291", outcome="rate_set_8.9pct", reasoning="Prime + 2.4% based on risk tier B2", confidence=0.99, ) # 构建可审计的因果链 - relationship_type 必须是 # CAUSED、INFLUENCED 或 PRECEDENT_FOR 之一 graph.add_causal_relationship(app_id, uw_id, relationship_type="CAUSED") graph.add_causal_relationship(uw_id, rate_id, relationship_type="INFLUENCED") # 查询智能链路 chain = graph.trace_decision_chain(rate_id) similar = graph.find_similar_decisions("personal loan approval, 31% DTI", max_results=5) impact = graph.analyze_decision_impact(uw_id) compliant = graph.check_decision_rules({"category": "loan_underwriting", "confidence": 0.94}) insights = graph.get_decision_insights() — ## 上下文图 上下文图是传统 RAG 所缺少的结构化记忆层。与只回答“什么相似?”的扁平嵌入不同,上下文图回答“什么相连、为什么相连、如何相连?”每个实体、关系、决策和事实都是一等节点,可通过图遍历进行查询。实体链接到源文档,决策链接到证据和后果,事实携带完整溯源,冲突会被检测,而不是被静默覆盖。 python from semantica.context import ContextGraph, AgentContext from semantica.vector_store import VectorStore graph = ContextGraph(advanced_analytics=True) # 添加带类型属性的节点 graph.add_node("acme_corp", "Organization", name="Acme Corp", industry="SaaS") graph.add_node("alice_chen", "Person", name="Alice Chen", role="CTO") graph.add_node("contract_001", "Contract", value=2_400_000, currency="USD") # 添加带类型的加权边(额外的 kwargs 成为边元数据) graph.add_edge("alice_chen", "acme_corp", edge_type="works_for", since="2019-03-01") graph.add_edge("acme_corp", "contract_001", edge_type="party_to", signed="2024-01-15") # BFS 遍历 - 从任意节点在图内跳跃 neighbors = graph.get_neighbors("acme_corp", hops=2) # 任意时点快照 - 图在过去任意日期的状态 snapshot = graph.state_at("2024-01-01") # AgentContext - 面向智能体记忆工作流的高级 API vs = VectorStore(backend="faiss") ctx = AgentContext(vector_store=vs, knowledge_graph=graph) ctx.store("Alice approved the Acme renewal in Q1 2024", conversation_id="conv_001") retrieved = ctx.retrieve("who approved the Acme contract?") 为什么图优于嵌入: 遍历能发现嵌入遗漏的连接(一个人距离合同 3 跳);每个节点都携带溯源,因此您总能问“这来自哪里?”*;冲突会在污染知识库之前被标记;任意时点快照让您无需重新处理即可回放历史。 — ## 实战:受监管决策的审计追踪 旗舰模式:记录一条因果关联的决策链,为每个实体附加溯源,并导出监管机构可直接使用的审计轨迹。 ``python from semantica.context import ContextGraph from semantica.provenance import ProvenanceManager from semantica.export import RDFExporter graph = ContextGraph(advanced_analytics=True) prov = ProvenanceManager(storage_path=“./audit.db”) # 记录决策链 d1 = graph.record_decision( category=“drug_interaction_check”, scenario=“Patient P-4821: warfarin + amiodarone co-prescribed”, reasoning=“Amiodarone potentiates warfarin’s anticoagulant effect”, outcome=“flag_for_review”, confidence=0.91, ) d2 = graph.record_decision( category=“dosage_adjustment”, scenario=“INR monitoring plan for P-4821”, reasoning=“Reduce warfarin dose per interaction severity; recheck INR in 5 days”, outcome=“dose_reduced_30pct”, confidence=0.87, ) # relationship_type 必须是 CAUSED、INFLUENCED 或 PRECEDENT_FOR 之一 graph.add_causal_relationship(d1, d2, relationship_type=“CAUSED”) # 为每个实体追踪溯源 prov.track_entity(“patient_P4821”, source=“ehr/medication_orders_2024.json”, metadata={“extractor”: “NamedEntityRecognizer”}) # 导出 W3C PROV-O 用于监管提交 - RDFExporter 期望 # {“entities”: […], “relationships”: […]},因此先将 ContextGraph.to_dict() 的 # {“nodes”: […], “edges”: […]} 形状映射到该结构 graph_dict
相似文章
@bakigulai:他们为AI代理做了一个开源的Palantir:Semantica。它将数据转化为知识图谱,记录代理的决策…
Semantica是一个开源的、自托管的平台,它将数据转换为知识图谱,记录AI代理的决策,并为可解释、可追溯的AI系统提供完整的来源追溯和确定性推理。
@UnTalNixon_exe:AI智能体最大的问题不是它们会产生幻觉,而是没有人能解释它们为什么做出某个决定。……
Semantica 是一个开源工具,可将任何数据转换为上下文图(Context Graph),记录每个 AI 智能体决策的完整因果链及 W3C PROV-O 溯源信息,为金融、医疗保健和政府领域提供确定性可解释性。
sem:一种语义粒度的新型代码理解原语工具
sem 是一款基于 Git 的 CLI 工具,能够提供代码变更的语义理解,支持跨 26 种语言的实体级别差异分析、代码追溯、影响分析等功能。其目标是改进代码审查和 AI 辅助开发。
为AI编码代理构建本地优先的上下文引擎——符号图+语义搜索,无需云端
Argyph 是一个开源 MCP 服务器,通过符号图和语义搜索为 AI 编码代理提供结构化的代码库理解,完全本地运行,无云端依赖。
从显式元素到隐式意图:用于可审计行为推理的预定义库
介绍SemantiClean,一个模块化框架,用于从电子商务会话数据中提取结构化语义信号,驱动可插拔推理目标(购买意图、客户细分、产品亲和力),同时优先考虑可审计性和结构透明度而非纯粹的准确性。