al-Qantara
全部文章

面向生成式 AI 的多源图谱数据分析架构

Lipie Souza2023年9月5日阅读约 1 分钟0 次浏览

分享
WhatsApp

本文由葡萄牙语原文自动翻译。阅读原文

组织的经典后现代难题:成堆的数据却生不出洞察。

从分析师到 CEO,各行各业的人都在挣扎:既要在决策中保持创造力,又要有事实和数据撑腰。生不出洞察的仪表盘、为佐证既定结论而做的逆向工程、压垮关键系统的抽取(ETL)例程 — 数据分析领域的问题五花八门。指标和度量只剩控制与跟踪的用途,仅此而已。信息零散而臃肿,创造性行动稀少。而**生成式 AI 恰恰能帮我们解开这个信息过载的死结!**这里打开了一种可能:这项技术自带对信息「推理」的能力,为我们呈现不带偏见的结论,供我们更广泛地创造性消费,降低认知负荷。我这篇分析的目的,正是提出一个帮助我们得出结论的架构 — 把语义机器放在这个至关重要的中间层,压缩海量数据、剔除冗余。

要提出这样一个对多源数据做实时分析的架构,几个问题必须先回答。其一:**LLM 的专长是文本(非结构化数据),它如何理解并吸收电子表格、图表、数据表这类结构化数据?**剧透:有中间产品帮我们做这件事。其他问题包括:面向生成式 AI 的 ETL 例程该如何组织?与现有架构的差异是什么?我认为最关键的问题是:如何把不同性质、不同维度的数据汇入一个真正能产生洞察的地方?还有 — 我们会继续以仪表盘的传统方式消费,还是会与模型对话?种种迹象表明:会是对话!好,我们逐一探讨:

生成式 AI 与结构化(非文本)数据的并入

LLM 以极其庞大的数据训练而成,其根基大部分是文本(非结构化、语义相关的数据)。但如果一个模型要并入多种结构化数据的信息 — 彼此没有语义关联、却有关系型关联 — 该怎么办?比如,如何把 SQL 库、电子表格和图谱里的原始数据直接注入一个自然语言模型?答案是:每种注入大概率需要不同的技术。对电子表格等关系型数据而言,可用的战术之一是所谓的知识图谱(Knowledge Graph),这个领域里开源框架一马当先,比如 Neo4j,它最近刚被并入 LangChain 🐦。Neo4j 做的不多不少,正是发现散布在 N 个结构各异的关系型库中的信息之间的推理关系。吊诡的是,这恰恰是许多公司面对的难题:在亿万张表和仪表盘之间交叉海量推理。

换句话说,Neo4j 及/或同类知识图谱管理器,把你的各种知识源 — 电子表格、仪表盘、SQL 抽取等等 —「插」进来,**汇编成可并入任何使用 LangChain 框架的 LLM 的形式。也就是说,语言模型通过图谱来理解表格。正如本博客反复讲解的向量数据库,知识图谱也在赢得一席之地:它们的差异化在于不依赖纯文本,能汇编不同类型库的数据,并发现其中隐藏的推理关联。**开源之外也有其他方案,比如 Microsoft Graph,对大企业是可行选项,尽管局限明显。想打造真正智能的数据中枢的企业,方案就在这里。:)

面向生成式 AI 的抽取、转换与加载(ETL)

与现有的 ETL 例程一样,用生成式 AI 消费战略数据的新产品同样需要转换流程 — 而且很贵!但这里有一个实实在在的优势差异,且听我讲。**第一:你可以终结那些「违章加建」和冗余,直接从 CRM、销售系统等核心系统的原始库构建知识图谱,砍掉所有只为出报表而存在的微服务中间库和副本。**仅此一项就能省下巨量算力。另一个优势是:这些框架能自主发现实体间的推理关系,几乎不需要数据工程 — 没错,你不用教它表「Y」里的「项目 X」对应销售表里同一个「项目 X」的「Z」笔销售,模型自己会做这些推理。这将为数据科学家省下大把时间 — 他们过去正是被雇来在传统机器学习模型中建模这些关系的。**它非常适合路径优化、欺诈检测、购买模式与客户行为识别等场景。**花在图谱训练 SaaS 上的钱,会因数据分析师从重复劳动中解放而回本。还在否认生成式 AI 将重塑我们的整个 IT 架构?该走出舒适区了!

数据消费:对话取代结构化仪表盘

最后,这可能是我们将随生成式 AI 经历的最大范式断裂。我们将更少消费汇编在仪表盘里的信息,转而向并入了实时交易数据的语言模型提问。数十年来,我们在企业日常、演示、研究与探索中辛苦打开一份份满是图表和文字说明的报告;今后,我们将与模型对话,它把这一切浓缩,我们则通过提问进行由模型自身生成的洞察所加持的推理!**我们准备好了吗?我想还没有,但我们在路上。这需要一场文化转变:不再等待过去的结果,而是开始想象未来情景的可能性。学会问对问题!**在企业独白中日渐麻木的我们,需要重新练习一件被搁置的事 — 对话!🍻

**附注:**这些文章不是 ChatGPT 写的。语言模型仍然缺乏创造力,但在技术工作和降低认知负荷上是强大的盟友。😎

评论 (0)

  • 还没有评论。来做第一个吧!

评论是公开的。

继续阅读

欧洲眨眼了:AI 法案的推迟,以及它给 PL 2338 的启示

程序化点击的终结:RPA、自主智能体,以及争夺企业自动化心脏的静默之战

记忆即基础设施:多智能体架构中的持久上下文如何重新定义客户服务

生成式 AI SaaS 产品定价:一个新的市场范式

Agent2Agent(谷歌)与 Model Context Protocol(MCP):智能体互联与 API 集成的架构性进化答案

在生成式 AI 智能体框架与 RPA 遗留系统之间求平衡

各位同仁,进化在路上 — Titans 架构:Transformer 潜在的进化替代方案

「广域上下文感知」:LLM 打造真正解决问题、理解客户的数字客服的潜力

LangSmith — 如何看清 LLM 的「推理」脉络,以改进你的微调?

用 LLM 做数据转换(ETL):Data Lake 项目的新思路

产品管理的未来:最新最有前景的 GenAI 无代码工具

Hugging Face — GenAI 数据科学家的游乐场

GenAI 的云基础设施 — 自动化与 RPA

第一代 LLM 构建工作室产品 — SaaS — FlowiseAI

开源:巴西技术创新危机的一条出路 — 一份公开宣言

营销与生成式 AI — 让对话产品更有创造力的假设与实验

Embeddings — 与你的数据对话的强大工具

微调对比 Embedding — 一个面向教育的产品用例

思考「AI 驱动」的产品团队 — 链式调用、伦理及其他

AI 现在会写代码了。对企业而言,这既是好事也是坏事。

Marketing LaB — 「对话式数字」时代的几个假设

RPA 技术对决多模态模型 — 这场变革将如何发生?

在巴西,LLM/GPT 的变革与落地会以怎样的速度、以怎样的方式发生?

基础模型与商业的未来

AI 时代已经开始