al-Qantara
全部文章

微调对比 Embedding — 一个面向教育的产品用例

Lipie Souza2023年6月4日阅读约 1 分钟0 次浏览

分享
WhatsApp

本文由葡萄牙语原文自动翻译。阅读原文

如许多人所知,GPT 及其他 LLM 技术提供了一个可被增强的对话与事实基座,但它的目标并不是充当通用聊天工具,而是作为一个可依应用目的加以打磨与演进的语言结构。著名的提示词(prompt)就在这里登场,用来调校模型。然而,还有另一种超越提示词的「增压」方式,叫做「embedding」。在这篇文章里,我以 ClippingGPT — 一个 100% 巴西制造、面向教育的产品 — 为例,详解这两种方法的差异。

先回顾一下什么是微调(Fine Tuning)。这是一种广为人知的做法,可以指示模型以特定方式行事:强调某些主题、回避另一些、处理文本。但它不产生新知识,因为 LLM 并不会因此被「重新训练」。关于微调有一点值得强调:人们经常动用 GPT-4 这样的超强模型去完成简单任务(比如历史学科的内容辅导),恰恰因为微调无法与较小的基座配合。结果就是用一个精密模型去执行简单任务 — 好比用大炮钉钉子。

相比之下,embedding 技术允许使用更简单、更经济的 LLM:比如把维基百科的全部历史条目并入模型,从而用一个更简单的语言模型给出更准确、更便宜的回答。Embedding 让你注入数据向量,维护也相对简单 — 想给知识库添加新知识,只需扩充这个向量库,内容会直接传导到模型的回答中,与产品无缝衔接。这与微调不同:微调后你必须检查是否有副作用、输出格式是否被改变等等。因此,embedding 能以更低成本、非常快速地扩展你的数据基座。在 OpenAI 社区里有一个讨论帖,附视频把这些差异讲得很清楚。

简而言之:微调适用于想给产品添加新能力、新任务的场景,而不是打磨同一任务 — 例如提供科学学科的辅导。

微调可能遭遇「幻觉」或「虚构」问题 — 即对模型应呈现的准确度的精细调校;调得不当,反而会加剧这个问题。还要指出:微调不是提示词工程。提示词工程是你规定模型该做什么;微调更进一步,允许调整回答的语气、随机化程度、输出格式 — 尽管更贵、需要更多测试。你也常会看到 embedding 技术的另一个名字:「语义搜索」(Semantic Search),因为它允许添加新内容、新的能指及其在并入模型的文本中衔接的所指。

案例研究:ClippingGPT

Clipping 是一家帮助考生在高竞争性考试中脱颖而出的初创公司。它在巴西外交官职业考试中拥有平均 94% 的通过率,自 2018 年起构建基于 AI 的教育对话界面 — 那一年它与 Magazine Luiza、PagSeguro、Rock in Rio 等品牌一同获得巴西 Bot Awards 最佳教育聊天机器人奖。今年年初,他们与米纳斯吉拉斯联邦大学(UFMG)计算机科学系及贝洛奥里藏特科技园(BHTEC)(他们也入驻于此)合作开发了一套论述题自动批改系统 — 一个专有算法。而最新发布的是 ClippingGPT(beta):一个旨在通过 1:1 个性化辅导帮助学生发挥最大潜能的 AI 导师。

许多人找到这家公司,想了解模型训练的细节 — 它不仅通过了外交官职业入门考试,还在这场以拉美最难著称的考试中超出 GPT-4 达 26%。这正是记录并分享这个案例的绝佳机会。

要点:

  1. 在教育中使用 ChatGPT 和 LLM 的主要问题不是作弊,而是幻觉导致的学习过程中的错误信息风险;

  2. 可以通过在外部知识库上训练模型来提升回答准确度,从而缓解这些风险;

  3. 在外部知识库上训练后,ClippingGPT 以优异成绩通过了外交官职业入门考试,超越了其他考生和 GPT-4;

  4. 一个在外部知识库上训练的 AI 以优异成绩通过最难的考试之一,这证明了 LLM 在教育领域构建 AI 导师的潜力。

完整的案例研究在这里。这是一个绝佳的例子,展示了 embedding 技术如何带来更准确的回答、更低的构建与维护成本,以及更少的幻觉与虚构。关键是针对每个场景思考该用哪种技术:仅提示词工程、语义并入(embedding),还是在最复杂的情况下动用微调。希望这篇文章让「何时用哪种技术」更清晰了。随着最大胆的公司陆续发布首批基于大语言模型的产品,我也会带来更多用例。:) 回头见。

评论 (0)

  • 还没有评论。来做第一个吧!

评论是公开的。

继续阅读

欧洲眨眼了:AI 法案的推迟,以及它给 PL 2338 的启示

程序化点击的终结:RPA、自主智能体,以及争夺企业自动化心脏的静默之战

记忆即基础设施:多智能体架构中的持久上下文如何重新定义客户服务

生成式 AI SaaS 产品定价:一个新的市场范式

Agent2Agent(谷歌)与 Model Context Protocol(MCP):智能体互联与 API 集成的架构性进化答案

在生成式 AI 智能体框架与 RPA 遗留系统之间求平衡

各位同仁,进化在路上 — Titans 架构:Transformer 潜在的进化替代方案

「广域上下文感知」:LLM 打造真正解决问题、理解客户的数字客服的潜力

LangSmith — 如何看清 LLM 的「推理」脉络,以改进你的微调?

用 LLM 做数据转换(ETL):Data Lake 项目的新思路

产品管理的未来:最新最有前景的 GenAI 无代码工具

Hugging Face — GenAI 数据科学家的游乐场

面向生成式 AI 的多源图谱数据分析架构

GenAI 的云基础设施 — 自动化与 RPA

第一代 LLM 构建工作室产品 — SaaS — FlowiseAI

开源:巴西技术创新危机的一条出路 — 一份公开宣言

营销与生成式 AI — 让对话产品更有创造力的假设与实验

Embeddings — 与你的数据对话的强大工具

思考「AI 驱动」的产品团队 — 链式调用、伦理及其他

AI 现在会写代码了。对企业而言,这既是好事也是坏事。

Marketing LaB — 「对话式数字」时代的几个假设

RPA 技术对决多模态模型 — 这场变革将如何发生?

在巴西,LLM/GPT 的变革与落地会以怎样的速度、以怎样的方式发生?

基础模型与商业的未来

AI 时代已经开始