开源本体RAG TrustGraph:企业知识库的下一站
基于RAG的AI知识库,是企业最早引入的AI技术。把文档丢进去,员工用自然语言提问——看起来,知识已经被AI使用了。落地之后,真正的裂缝才露出:AI能找到相关资料,却不一定真正理解企业的业务。
01 检索成功,并不等于理解成功
产品文档、内部制度、客服记录、项目资料、数据库接入 RAG 之后,提问变得廉价。这一步诱惑极大,因为它把“找文件”改成了“问一句”。
企业里真正难的从来不是“有没有一段文字”。同一个词,在不同部门可能有不同含义;一项业务决策,往往同时涉及客户、产品、合同、人员、审批、政策和时间;一条结论,也可能需要跨越多个系统才能验证。
这时问题不再是能不能检索到一段文字,而是能不能理解企业世界中的概念和关系。
缺的是钉子。这个“客户”是签约主体、付款账户,还是终端使用者?这份“通过”是法务预审、风控放行,还是董事会决议?没有钉子,大模型只是在各部门方言里做相似度赌博。
02 为什么轮到 Ontology
这正是 Ontology(本体)开始变得重要的原因。本体不是又一份 FAQ,它是对世界的立法:有哪些类,类与类允许何种关系,属性值域是什么,哪条规则会让一次推理非法。
没有本体
向量库把“客户投诉”“大客户策略”“客户主数据”切成近邻。模型觉得它们像,于是把销售口径写进客服回复。
有本体
Customer、Counterparty、EndUser 是不同的类。投诉挂 Case,策略挂 AccountPlan,主数据挂 Party。相似不再等于可替换。
TrustGraph 被放在这个位置:围绕企业上下文、Ontology、知识图谱、RAG 与 Agent 的开源项目。它要做的不是让大模型更会搜文档,而是把企业数据做成一层可理解、可检索、可追踪、可治理的 AI 上下文。
03 TrustGraph 想成为哪一层
官方自称 Context Operating System / 上下文编排层。模型已经很多,缺的是模型脚下不会随便漂移的地面。
标准图谱常停在二元关系:文档 → 作者。企业真实事件是多元的:文档、作者、审批经理、合规政策、时间地点,同时构成一次“发生过的事”。TrustGraph 用超图 / holonic context graph 接住 n 元关系,并把实体、关系、证据都当作一等公民。
Context Core
- 本体与映射
- 图上的实体、关系、证据
- 向量索引作入口
- 出处与派生过程
可版本化、可装卸、可在项目间搬运。把上下文当代码发布。
三种检索
- DocumentRAG:段落相似
- GraphRAG:沿关系行走
- OntologyRAG:按立法抽取与回答
同一句问话,三种地面,三种诚实。
04 原文如何变成可追问的世界
架构不是“一个向量库 + 一段 prompt”。它更像工厂:处理器很小,靠消息总线咬合。
pdf-decoder→chunker→kg-extract→triple-store→embeddings→graph-rag→prompt→text-completion
图存储可插 Cassandra / Neo4j / Memgraph / FalkorDB;向量可插 Qdrant / Milvus;对象存 Garage;消息走 Pulsar。Agent 按 ReAct:想、选工具、看结果、再想,直到任务被图上的证据按住。
GraphRAG 不是 TopK 段落。它先把问题拆成概念,用向量找入口实体,沿边走出子图,给边打分,解释这条边为什么相关,同时顺着出处链回到源文档,最后才合成答案。解释不是事后贴的标签,是图上的数据。
OntologyRAG 更苛刻。抽取时先对本体自身做一次检索,只把相关类和属性放进上下文,再要求模型按这部小宪法提取。领域精密、合规要类型稳定时,这一步值钱;世界还没立法、术语天天改时,先用 GraphRAG 发现,再把稳定部分升成本体。
05 Agent 需要的不是更长窗口
窗口再长,也只是把更多方言一次性倒进耳朵。Agent 要的是:问“这个折扣能不能批”,系统能走到合同条款、客户等级、审批矩阵、上次例外和当前政策生效日,而不是拼一段像领导讲话的安慰。
所以它强调 Workspace、Collection、Core 的隔离,强调 provenance,强调可审计。企业要的不是更会说话的实习生,是能把推理链条摊在桌上的同事。
06 什么时候不该上本体
本体有成本。它要求有人敢为词立法,并在业务改口时改法。
先别上
扫描件垃圾山、权限未通、没有术语主人、试点还在比谁答得更像人。这时上本体,只是把混乱正式注册成体系。
应该上
合同、医疗、金融风控、供应链、跨系统审批。类型一旦错了会赔钱、会违规、会让两个部门打起来。这时相似检索是事故预兆。
07 下一站到底是什么
标题里的“下一站”,不是再买一个更贵的向量库。下一站是承认:企业知识库的对手从来不是“找不到”,而是“找得到却用错”。
TrustGraph 会不会成为事实标准,还要看治理、抽取质量和组织愿不愿意养本体。但它把战场标对了。企业AI的瓶颈,从生成,移到了意义。
去「实验」用同一个词拷打三种 RAG。去「流水线」看一次抽取如何被钉住。去「判决」把公司的真实情况拨到尺子上。