面向生成式 AI 的多源图谱数据分析架构
Lipie Souza2023年9月5日阅读约 1 分钟0 次浏览
本文由葡萄牙语原文自动翻译。阅读原文
组织的经典后现代难题:成堆的数据却生不出洞察。

从分析师到 CEO,各行各业的人都在挣扎:既要在决策中保持创造力,又要有事实和数据撑腰。生不出洞察的仪表盘、为佐证既定结论而做的逆向工程、压垮关键系统的抽取(ETL)例程 — 数据分析领域的问题五花八门。指标和度量只剩控制与跟踪的用途,仅此而已。信息零散而臃肿,创造性行动稀少。而**生成式 AI 恰恰能帮我们解开这个信息过载的死结!**这里打开了一种可能:这项技术自带对信息「推理」的能力,为我们呈现不带偏见的结论,供我们更广泛地创造性消费,降低认知负荷。我这篇分析的目的,正是提出一个帮助我们得出结论的架构 — 把语义机器放在这个至关重要的中间层,压缩海量数据、剔除冗余。
要提出这样一个对多源数据做实时分析的架构,几个问题必须先回答。其一:**LLM 的专长是文本(非结构化数据),它如何理解并吸收电子表格、图表、数据表这类结构化数据?**剧透:有中间产品帮我们做这件事。其他问题包括:面向生成式 AI 的 ETL 例程该如何组织?与现有架构的差异是什么?我认为最关键的问题是:如何把不同性质、不同维度的数据汇入一个真正能产生洞察的地方?还有 — 我们会继续以仪表盘的传统方式消费,还是会与模型对话?种种迹象表明:会是对话!好,我们逐一探讨:
生成式 AI 与结构化(非文本)数据的并入
LLM 以极其庞大的数据训练而成,其根基大部分是文本(非结构化、语义相关的数据)。但如果一个模型要并入多种结构化数据的信息 — 彼此没有语义关联、却有关系型关联 — 该怎么办?比如,如何把 SQL 库、电子表格和图谱里的原始数据直接注入一个自然语言模型?答案是:每种注入大概率需要不同的技术。对电子表格等关系型数据而言,可用的战术之一是所谓的知识图谱(Knowledge Graph),这个领域里开源框架一马当先,比如 Neo4j,它最近刚被并入 LangChain 🐦。Neo4j 做的不多不少,正是发现散布在 N 个结构各异的关系型库中的信息之间的推理关系。吊诡的是,这恰恰是许多公司面对的难题:在亿万张表和仪表盘之间交叉海量推理。

换句话说,Neo4j 及/或同类知识图谱管理器,把你的各种知识源 — 电子表格、仪表盘、SQL 抽取等等 —「插」进来,**汇编成可并入任何使用 LangChain 框架的 LLM 的形式。也就是说,语言模型通过图谱来理解表格。正如本博客反复讲解的向量数据库,知识图谱也在赢得一席之地:它们的差异化在于不依赖纯文本,能汇编不同类型库的数据,并发现其中隐藏的推理关联。**开源之外也有其他方案,比如 Microsoft Graph,对大企业是可行选项,尽管局限明显。想打造真正智能的数据中枢的企业,方案就在这里。:)
面向生成式 AI 的抽取、转换与加载(ETL)

与现有的 ETL 例程一样,用生成式 AI 消费战略数据的新产品同样需要转换流程 — 而且很贵!但这里有一个实实在在的优势差异,且听我讲。**第一:你可以终结那些「违章加建」和冗余,直接从 CRM、销售系统等核心系统的原始库构建知识图谱,砍掉所有只为出报表而存在的微服务中间库和副本。**仅此一项就能省下巨量算力。另一个优势是:这些框架能自主发现实体间的推理关系,几乎不需要数据工程 — 没错,你不用教它表「Y」里的「项目 X」对应销售表里同一个「项目 X」的「Z」笔销售,模型自己会做这些推理。这将为数据科学家省下大把时间 — 他们过去正是被雇来在传统机器学习模型中建模这些关系的。**它非常适合路径优化、欺诈检测、购买模式与客户行为识别等场景。**花在图谱训练 SaaS 上的钱,会因数据分析师从重复劳动中解放而回本。还在否认生成式 AI 将重塑我们的整个 IT 架构?该走出舒适区了!
数据消费:对话取代结构化仪表盘
最后,这可能是我们将随生成式 AI 经历的最大范式断裂。我们将更少消费汇编在仪表盘里的信息,转而向并入了实时交易数据的语言模型提问。数十年来,我们在企业日常、演示、研究与探索中辛苦打开一份份满是图表和文字说明的报告;今后,我们将与模型对话,它把这一切浓缩,我们则通过提问进行由模型自身生成的洞察所加持的推理!**我们准备好了吗?我想还没有,但我们在路上。这需要一场文化转变:不再等待过去的结果,而是开始想象未来情景的可能性。学会问对问题!**在企业独白中日渐麻木的我们,需要重新练习一件被搁置的事 — 对话!🍻
**附注:**这些文章不是 ChatGPT 写的。语言模型仍然缺乏创造力,但在技术工作和降低认知负荷上是强大的盟友。😎
评论 (0)
- 还没有评论。来做第一个吧!














