RPA 技术对决多模态模型 — 这场变革将如何发生?
Lipie Souza2023年4月30日阅读约 1 分钟0 次浏览
本文由葡萄牙语原文自动翻译。阅读原文
这两种技术之间存在显著差异。在这篇文章里,我将解释我所认为的、超越炒作的变革路径。

RPA(Robotic Process Automation,机器人流程自动化)技术诞生于 2000 年代,作为自动化重复性手工任务的方案,让企业提升运营效率、降低成本。起初它被视为后台自动化工具,处理数据录入、文件操作等简单任务。企业开始小规模测试这项技术,主要是评估潜力、识别用例。随着时间推移,当企业看到实实在在的收益 — 减少人为错误、提升生产力 — RPA 的接受度不断上升。
2016-2018 年起,这些举措开始进入巴西企业,从银行起步,蔓延到其他组织。这项技术落地的最大挑战之一,是 RPA 与遗留系统和流程的集成。自动化经常因机器人与既有系统不兼容而失败,需要投入大量精力适配和升级 RPA 方案以保证集成成功。而这正是这项技术难以逾越的最大局限:RPA 往往依赖与遗留系统的 UI(用户界面)交互来分析和操纵数据,这带来了流程开销和一堆系统「补丁」。归根结底,RPA 技术并没有让流程被重新思考,只是提升了产出和效率 — 其中一些流程数十年未变,常常包含不必要的、或不适应当前业务语境的环节。

大多数时候,RPA「跑」在人们日常使用的同一批界面上!
多模态 GPT 模型 多模态模型正在革新软件的构建方式以及人类与软件的交互方式。这些模型组合不同的输入输出模态 — 文本、语音、图像、视频 — 创造更丰富、更沉浸的用户体验。与主要通过图形用户界面(GUI)进行视觉交互的传统窗口式系统不同,多模态模型在多个感官层面探索人与数字智能体的交互,提供更整体、更直觉的方式。以 GPT-4 **为例:它组合文本与图像输入、输出文本,在分析任务上显著更强,且无需额外训练 — 凭借应用的便利性,它可能迅速取代 RPA。**下面是 GPT-4 面对一个涉及图像与批判性思考的分析时的表现(想想技术支持流程,比如):
User: What is funny about this image? Describe it panel by panel.

GPT-4: The image shows a package for a "Lightning Cable" adapter with three panels.
Panel 1: A smartphone with a VGA connector (a large, blue, 15-pin connector typically used for computer monitors) plugged into its charging port.
Panel 2: The package for the "Lightning Cable" adapter with a picture of a VGA connector on it.
Panel 3: A close-up of the VGA connector with a small Lightning connector (used for charging iPhones and other Apple devices) at the end.
The humor in this image comes from the absurdity of plugging a large, outdated VGA connector into a small, modern smartphone charging port.
多模态模型正变得越来越精密和准确。以 GPT-4 为例,它在法律、复杂数学分析等不同主题上的准确率已突破 80% 大关。完整分析在此。而对于更日常的活动,加上自有数据库,**这个水平还能显著提升,超越由人和 RPA 执行的例行流程的错误率。**与 RPA 不同 — 我想强调 — 它不需要预先训练,最多需要一次简单得多的补充训练:基本上就是添加一份额外的「阅读」材料,模型会自然吸收,无需给数据打标签或提供内容分析的「推理」示例。一大进步。
另一大差异是用无代码/低代码工具替换在产系统的便利性。例如,一个如今靠 RPA 辅助分析和批准付款的发票核对系统,可以轻松换成一条在「后台」运行的流程:接收文档、批准、把结果直接写入数据库,全程不需要图形界面。而且,这些模型还理解背后的数据结构 — 无需训练(顶多打磨一下)它们如何「写入」这些数据。
很快,LLM 应用将轻松理解并管理你的数据库。
OpenAI 自己就在用这个策略:为 ChatGPT 推出「插件」— 你为自己的 API 构建一份公开的清单,模型就能理解该采取哪些动作、如何消费这些端点(原谅我的技术黑话)。
另一个例子是 LangChain、LlamaIndex 这样的开源项目,它们帮你构建一个组合你的 API 数据的 LLM 应用,「魔法般地」理解如何读取它们。目前的局限在保存/持久化数据上 — 尽管已有变通方案,这些项目还不支持向 API 写数据。但这也可以通过加一个控制应用解决:根据用户动作,经由连接器、webhook、API 等把数据存入你的库。这个库还非常新、近几个月演进飞快,我相信很快就会有服务能自动发现如何通过 API/webhook 把对话数据存入你的库。一个不那么遥远的未来
有了这个自动化水平,创建新的对话式应用 — 理解并操纵你的数据、只需极少训练就能做分析 — 将简单得多。回到发票核对的例子:我们将「告诉」模型去哪里找待处理文档,用清晰的自然语言说明要做什么分析 —「检查金额是否在预算 X 内、到期日是否早于 Y,等等,另外排查欺诈痕迹」— 然后通过 API Z 的一个 post 保存。我们离这不远了 — 也许现在只差「包装得更好」的 API,无论是开源的,还是 Azure、Google Cloud 提供的。但用现有的库,这已经可以构建出来。
这些技术不仅会降低重新思考流程的成本,落地本身也会更便宜。今天 RPA 需要昂贵的许可证、虚拟机开销和细致的代码维护,而且是「按现状 — as is」贴着流程走。LLM 只花流量数据和云上运行的服务的钱,还允许用自然语言重新思考流程!因此我相信,它很快就会成为当红技术,超越「ChatGPT」的著名炒作。
评论 (0)
- 还没有评论。来做第一个吧!















