Hugging Face — GenAI 数据科学家的游乐场
Lipie Souza2023年9月20日阅读约 1 分钟0 次浏览
本文由葡萄牙语原文自动翻译。阅读原文
在生成式 AI 竞赛中,世界上已经涌现出许多明星初创公司。YCombinator 的加速投资很大一部分已流向这些迅速崛起的企业,它们在众多爱好者的讨论与实验中占据了一席之地。Hugging Face,连同本博客分析过的其他对象,也获得了大量投资。这背后有一个高尚的理由,且听我解释:这家公司一直在汇集、策展并简化基于预训练模型的机器学习算法的获取,极大地便利了每一位数据科学家的工作,更重要的是,它推动了生成式预训练模型的采用,为针对各种机器学习问题创建定制模型按下了加速键。在这篇文章里,我将展示它给数据从业者日常带来的好处,并用几个例子把这些好处讲得具体一点。😉

上图为 YCombinator 在生成式 AI 领域的加速投资地图。
首先我们需要更好地回顾 GPT 的背景:它们是用海量文本数据预训练的 Transformer 模型。与传统模型不同,Transformer 通过基于分词(tokenization)的训练过程理解词与词之间的语义关系,用统计方法区分每个 token 的含义。**这意味着什么?预训练模型是一个可观的语言基座,你可以用简单得多的方式往里面注入新的语义,而无需从零训练模型。**这省下了工程师和数据科学家清洗、转换原始数据,再反复尝试各种训练方式直到误差率降低的大量时间。有了预训练模型,只需接入一个独立的数据集即可 — 而且这个接入过程相当日常,因为我们有一种叫 embedding 的技术,它基本上是把这个数据集「翻译」成 Transformer 的语言,也就是语义存储向量。在这篇文章里回顾这个过程。
这些向量不多不少,正是 LLM 并入其预训练基座的一个独立知识口袋。那么,Hugging Face 在这盘棋里扮演什么角色?他们做的正是提供把这些数据集与预训练模型「拼在一起」所需的算法。不同的目标有不同的算法:从图像识别、情感分析、文本生成,到预测模型(没错,连经济学家和风险分析师钟爱、市场上炙手可热的时间序列 ML 应用,也有对应的 LLM)。真的,在 Hugging Face 上你已经能找到用于预测分析的预训练模型(我发现这一点时惊掉了下巴)。这是 AI 领域一次重要的进化:你不用再反复调试线性回归变量、在深度学习模型里排列感知机、试图施展魔法获得好的拟合 — 因为你将拥有一个专门训练来识别时间序列模式的 GPT。呼,这让我想起过去的项目:我们需要得出最优售价,但构建模型的工作堪称赫拉克勒斯式的苦役,而且非常「手工作坊」。😓
Hugging Face 这样的社区为这个领域带来的便利,究竟推动了什么变化?很多时候,我们不再需要深入代码(通常是 Python)才能为特定问题构建神经网络。 IT 世界向低代码架构迁移的趋势已经在许多领域成为现实,如今也在数据科学中蔓延。这并不意味着精通 TensorFlow、PyTorch 等 ML 库的专家会失去价值 — 掌握底层代码知识,在解决复杂问题或为成熟库注入个性化时,永远是竞争优势。但**必须指出:拥抱开源算法和无代码/低代码框架,能大大加快机器学习项目的落地速度。**关键是结合两个世界的精华:采用开源与低代码的算法和框架,加速机器学习项目的实施。
革命正在发生,创新之门向所有人敞开!让我们把专家与通才、开发者、科学家与管理者的力量汇聚起来 — 此刻我们需要的是更多实验、角色之间的更多交叉,以及更少僵化的结构。创造力只能像在游乐场里玩耍那样被构建 — 还要配上 Hugging(拥抱)。 🤗
评论 (0)
- 还没有评论。来做第一个吧!















