CONTEXT OPERATING SYSTEM
TG-OMNIBUS
unsealing article kernel…
OPEN SOURCE · ONTOLOGY RAG · AGENT CONTEXT

开源本体RAG TrustGraph:企业知识库的下一站

基于RAG的AI知识库,是企业最早引入的AI技术。把文档丢进去,员工用自然语言提问——看起来,知识已经被AI使用了。落地之后,真正的裂缝才露出:AI能找到相关资料,却不一定真正理解企业的业务。

文本协议。头条页动态渲染并反爬。开篇与核心论断来自原文核实;后文按作者分析对象 TrustGraph 官方架构/检索文档结构化重制,供实验,不替代原文。点金色划线可钉术语。⌘K 打开命令面板。

01 检索成功,并不等于理解成功

产品文档、内部制度、客服记录、项目资料、数据库接入 RAG 之后,提问变得廉价。这一步诱惑极大,因为它把“找文件”改成了“问一句”。

企业里真正难的从来不是“有没有一段文字”。同一个词,在不同部门可能有不同含义;一项业务决策,往往同时涉及客户、产品、合同、人员、审批、政策和时间;一条结论,也可能需要跨越多个系统才能验证。

这时问题不再是能不能检索到一段文字,而是能不能理解企业世界中的概念和关系

企业通常并不缺资料。企业AI真正缺的,可能不是更多文档。

缺的是钉子。这个“客户”是签约主体、付款账户,还是终端使用者?这份“通过”是法务预审、风控放行,还是董事会决议?没有钉子,大模型只是在各部门方言里做相似度赌博。

02 为什么轮到 Ontology

这正是 Ontology(本体)开始变得重要的原因。本体不是又一份 FAQ,它是对世界的立法:有哪些类,类与类允许何种关系,属性值域是什么,哪条规则会让一次推理非法。

没有本体

向量库把“客户投诉”“大客户策略”“客户主数据”切成近邻。模型觉得它们像,于是把销售口径写进客服回复。

有本体

Customer、Counterparty、EndUser 是不同的类。投诉挂 Case,策略挂 AccountPlan,主数据挂 Party。相似不再等于可替换。

TrustGraph 被放在这个位置:围绕企业上下文、Ontology、知识图谱、RAG 与 Agent 的开源项目。它要做的不是让大模型更会搜文档,而是把企业数据做成一层可理解、可检索、可追踪、可治理的 AI 上下文

03 TrustGraph 想成为哪一层

官方自称 Context Operating System / 上下文编排层。模型已经很多,缺的是模型脚下不会随便漂移的地面。

标准图谱常停在二元关系:文档 → 作者。企业真实事件是多元的:文档、作者、审批经理、合规政策、时间地点,同时构成一次“发生过的事”。TrustGraph 用超图 / holonic context graph 接住 n 元关系,并把实体、关系、证据都当作一等公民。

Context Core

  • 本体与映射
  • 图上的实体、关系、证据
  • 向量索引作入口
  • 出处与派生过程

可版本化、可装卸、可在项目间搬运。把上下文当代码发布。

三种检索

  • DocumentRAG:段落相似
  • GraphRAG:沿关系行走
  • OntologyRAG:按立法抽取与回答

同一句问话,三种地面,三种诚实。

04 原文如何变成可追问的世界

架构不是“一个向量库 + 一段 prompt”。它更像工厂:处理器很小,靠消息总线咬合。

pdf-decoderchunkerkg-extracttriple-storeembeddingsgraph-ragprompttext-completion

图存储可插 Cassandra / Neo4j / Memgraph / FalkorDB;向量可插 Qdrant / Milvus;对象存 Garage;消息走 Pulsar。Agent 按 ReAct:想、选工具、看结果、再想,直到任务被图上的证据按住。

GraphRAG 不是 TopK 段落。它先把问题拆成概念,用向量找入口实体,沿边走出子图,给边打分,解释这条边为什么相关,同时顺着出处链回到源文档,最后才合成答案。解释不是事后贴的标签,是图上的数据。

OntologyRAG 更苛刻。抽取时先对本体自身做一次检索,只把相关类和属性放进上下文,再要求模型按这部小宪法提取。领域精密、合规要类型稳定时,这一步值钱;世界还没立法、术语天天改时,先用 GraphRAG 发现,再把稳定部分升成本体。

05 Agent 需要的不是更长窗口

窗口再长,也只是把更多方言一次性倒进耳朵。Agent 要的是:问“这个折扣能不能批”,系统能走到合同条款、客户等级、审批矩阵、上次例外和当前政策生效日,而不是拼一段像领导讲话的安慰。

所以它强调 Workspace、Collection、Core 的隔离,强调 provenance,强调可审计。企业要的不是更会说话的实习生,是能把推理链条摊在桌上的同事。

写上下文一次,在任何 Agent 上运行。这是对“每次对话都从零检索”的拒绝。

06 什么时候不该上本体

本体有成本。它要求有人敢为词立法,并在业务改口时改法。

先别上

扫描件垃圾山、权限未通、没有术语主人、试点还在比谁答得更像人。这时上本体,只是把混乱正式注册成体系。

应该上

合同、医疗、金融风控、供应链、跨系统审批。类型一旦错了会赔钱、会违规、会让两个部门打起来。这时相似检索是事故预兆。

07 下一站到底是什么

标题里的“下一站”,不是再买一个更贵的向量库。下一站是承认:企业知识库的对手从来不是“找不到”,而是“找得到却用错”。

TrustGraph 会不会成为事实标准,还要看治理、抽取质量和组织愿不愿意养本体。但它把战场标对了。企业AI的瓶颈,从生成,移到了意义。

去「实验」用同一个词拷打三种 RAG。去「流水线」看一次抽取如何被钉住。去「判决」把公司的真实情况拨到尺子上。

LAB

同一句问话,三种地面

选择企业里最容易被向量库背叛的词。

部门方言

PIPELINE

一次文档如何变成可追问的世界

GraphRAG 查询十步

概念抽取 → 嵌入 → 实体入口 → 子图展开 → 语义预过滤 → 边打分 → 边解释 → 出处回溯 → 答案合成 → 解释三元组落图。

OntologyRAG 额外一刀

先对本体自身做 GraphRAG,只把相关类/属性放进抽取上下文。模型不得发明法外关系。

DocumentRAGGraphRAGOntologyRAG
单位段落实体-关系受约束的类与属性
诚实来源相似连通立法
失败模式近邻串味图不完整法过时或无人养护
适用找原文找关联要类型正确
ONTOLOGY

一部最小可用的企业宪法

点类看约束。这不是完整行业本体,是文章里那个“客户/通过/项目/政策”冲突的立法草案。

选择一个类

类一旦被点亮,提问必须声明问的是它,而不是词面。

HYPERGRAPH

一次折扣审批的超图

拖拽节点。点击查看类、约束、出处。

选择一个节点

每条边都是可审计断言,不是“感觉相关”。

超图要表达的事

不是 Document→Author。是客户等级、合同条款、审批人、政策版本、生效时间,同时构成“这次折扣是否合法”。

ASK THE ARTICLE

把本文当成一个 Context Core

这是对文章自身做的微型 GraphRAG,不是联网搜索。

VERDICT

要不要把知识库升级成本体层

LIVE GRAPH
GLOSSARY
CONSOLE
OMNIBUS ready.\n⌘K command palette.

命令与键盘

1-7 切模式 · ⌘K / Ctrl+K 命令面板

/ 检索正文 · G 图谱 · N 添加批注 · ? 本页

金色划线钉术语。实验页用同一个问题拷打三种 RAG。判决页把组织准备度收成尺子。

命令面板

批注