微调对比 Embedding — 一个面向教育的产品用例
Lipie Souza2023年6月4日阅读约 1 分钟0 次浏览
本文由葡萄牙语原文自动翻译。阅读原文

如许多人所知,GPT 及其他 LLM 技术提供了一个可被增强的对话与事实基座,但它的目标并不是充当通用聊天工具,而是作为一个可依应用目的加以打磨与演进的语言结构。著名的提示词(prompt)就在这里登场,用来调校模型。然而,还有另一种超越提示词的「增压」方式,叫做「embedding」。在这篇文章里,我以 ClippingGPT — 一个 100% 巴西制造、面向教育的产品 — 为例,详解这两种方法的差异。
先回顾一下什么是微调(Fine Tuning)。这是一种广为人知的做法,可以指示模型以特定方式行事:强调某些主题、回避另一些、处理文本。但它不产生新知识,因为 LLM 并不会因此被「重新训练」。关于微调有一点值得强调:人们经常动用 GPT-4 这样的超强模型去完成简单任务(比如历史学科的内容辅导),恰恰因为微调无法与较小的基座配合。结果就是用一个精密模型去执行简单任务 — 好比用大炮钉钉子。
相比之下,embedding 技术允许使用更简单、更经济的 LLM:比如把维基百科的全部历史条目并入模型,从而用一个更简单的语言模型给出更准确、更便宜的回答。Embedding 让你注入数据向量,维护也相对简单 — 想给知识库添加新知识,只需扩充这个向量库,内容会直接传导到模型的回答中,与产品无缝衔接。这与微调不同:微调后你必须检查是否有副作用、输出格式是否被改变等等。因此,embedding 能以更低成本、非常快速地扩展你的数据基座。在 OpenAI 社区里有一个讨论帖,附视频把这些差异讲得很清楚。
简而言之:微调适用于想给产品添加新能力、新任务的场景,而不是打磨同一任务 — 例如提供科学学科的辅导。
微调可能遭遇「幻觉」或「虚构」问题 — 即对模型应呈现的准确度的精细调校;调得不当,反而会加剧这个问题。还要指出:微调不是提示词工程。提示词工程是你规定模型该做什么;微调更进一步,允许调整回答的语气、随机化程度、输出格式 — 尽管更贵、需要更多测试。你也常会看到 embedding 技术的另一个名字:「语义搜索」(Semantic Search),因为它允许添加新内容、新的能指及其在并入模型的文本中衔接的所指。
案例研究:ClippingGPT
Clipping 是一家帮助考生在高竞争性考试中脱颖而出的初创公司。它在巴西外交官职业考试中拥有平均 94% 的通过率,自 2018 年起构建基于 AI 的教育对话界面 — 那一年它与 Magazine Luiza、PagSeguro、Rock in Rio 等品牌一同获得巴西 Bot Awards 最佳教育聊天机器人奖。今年年初,他们与米纳斯吉拉斯联邦大学(UFMG)计算机科学系及贝洛奥里藏特科技园(BHTEC)(他们也入驻于此)合作开发了一套论述题自动批改系统 — 一个专有算法。而最新发布的是 ClippingGPT(beta):一个旨在通过 1:1 个性化辅导帮助学生发挥最大潜能的 AI 导师。
许多人找到这家公司,想了解模型训练的细节 — 它不仅通过了外交官职业入门考试,还在这场以拉美最难著称的考试中超出 GPT-4 达 26%。这正是记录并分享这个案例的绝佳机会。
要点:
在教育中使用 ChatGPT 和 LLM 的主要问题不是作弊,而是幻觉导致的学习过程中的错误信息风险;
可以通过在外部知识库上训练模型来提升回答准确度,从而缓解这些风险;
在外部知识库上训练后,ClippingGPT 以优异成绩通过了外交官职业入门考试,超越了其他考生和 GPT-4;
一个在外部知识库上训练的 AI 以优异成绩通过最难的考试之一,这证明了 LLM 在教育领域构建 AI 导师的潜力。
完整的案例研究在这里。这是一个绝佳的例子,展示了 embedding 技术如何带来更准确的回答、更低的构建与维护成本,以及更少的幻觉与虚构。关键是针对每个场景思考该用哪种技术:仅提示词工程、语义并入(embedding),还是在最复杂的情况下动用微调。希望这篇文章让「何时用哪种技术」更清晰了。随着最大胆的公司陆续发布首批基于大语言模型的产品,我也会带来更多用例。:) 回头见。
评论 (0)
- 还没有评论。来做第一个吧!














