用 LLM 做数据转换(ETL):Data Lake 项目的新思路
Lipie Souza2024年2月12日阅读约 1 分钟0 次浏览
本文由葡萄牙语原文自动翻译。阅读原文
又一个有趣的用例:把自然语言处理(带认知推理)与结构化数据分析流程结合起来
到 2024 年 2 月,我围绕生成式 AI 的学习与实验刚好满 10 个月。这期间我与许多人交流,发布了一个实验性产品,理解了这项技术的某些局限 — 其中不少我认为是暂时的 — 并随着时间推移,对它的落地路径形成了更有依据、更现实的判断。
现在我又遇到一个用例:从 LLM 的固有特性看它似乎显而易见,却一直被忽视。大语言模型非常擅长从语言学视角分析结构化数据,就像我们人类思考时那样 — 当然,LLM 目前仍然相当初级,串联假设进行复杂推理的能力还很弱。然而,有一项活动恰好落在这个有限的能力范围内:解读特定业务流程的关系型数据表,并把它们转换为多维数据 — 带上正确的键关联及其对应的事实与事件。(这活儿是不是可以叫「苦差事」?😢)当然,市面上已有执行转换本身的工具,但它们必然要求一位人类分析师先理解每张表、每个字段、每种数据类型之间的关系与上下文。这篇文章正是要分析:让语言模型替我们完成这件事到底有多可行。起点是这篇 IEEE 2023 年 9 月的论文。
这项由亚利桑那大学、天津大学等知名高校主导、微软支持的研究表明:LLM 有能力理解一个涉及数据库的复杂知识领域,并为大数据 / Data Lake 项目高效完成转换。**研究聚焦建筑能效领域的知识库,目标是统一、规范并集中来自不同来源的数据,构建一个用于能耗监测研究的全球数据库。**该项目由电气电子工程师学会(IEEE)发起。这项研究的意义在于:我们已经知道 LLM 在复杂数学计算上的局限,但由于这里的数值转换简单且重复,**最终在 105 个跨数据模式的转换问题上取得了 96% 的准确率。**下面是三个会交给该算法(名为 SQLMorpher)处理的转换示例。

这个算法采用了本博客已探讨过的技术进行训练。训练数据由过往的 SQL 转换组成,并以提示词补充上下文:说明目标任务、模式之间的 SQL 修改、所用的知识领域,以及经过评估的正确结果及其理由。利用本博客介绍过的 embedding 技术,研究者构建了一个向量数据库(Faiss)。**这个训练库支撑起一个迭代过程:逐步修改提示词,直到得到预期的转换结果。**相对于以往的 LLM 研究,这篇论文的最大新意在于用交互循环来优化提示词。当预期结果被正确映射时,这一策略非常有效,而且看起来很容易复制到涉及代码生成的应用中。借助该技术,准确率几乎达到了 100%:

这些实验为 LLM 的使用提出了新问题,也指出了中短期内的潜在应用。基于这项研究的结果,我们可以做出几点判断:
1. LLM 需要精调和上下文才能在特定问题分析中表现良好。这意味着,对于目前由 IT、财务、市场等领域分析师执行的大多数操作性工作,都需要专门训练的 LLM。
2. 语言分析与简单数学问题交织的任务,是 LLM 自动化的绝佳候选。
3. 这些实验预示着谷歌、亚马逊、微软等巨头产品团队内部已经在进行的工作。「powered by LLMs」的应用在未来数月和数年内崭露头角,只是时间问题。
在那之前,我们将与「传统应用 + 一撮生成式 AI」共存。**这些应用会部分优化企业现有的流程。然而,只有依靠专门训练的 LLM,运营工作的组织方式才会出现指数级的生产力跃升。**让我们持续关注!继续实验。😎
评论 (0)
- 还没有评论。来做第一个吧!















