al-Qantara
全部文章

LangSmith — 如何看清 LLM 的「推理」脉络,以改进你的微调?

Lipie Souza2024年7月4日阅读约 1 分钟0 次浏览

分享
WhatsApp

本文由葡萄牙语原文自动翻译。阅读原文

为特定场景定制 LLM 是一门近乎手工的艺术,一个试错的过程。乍看并不复杂:你去弄明白哪个基座模型最适合要解决的问题 — 比如你可能需要一个逻辑推理更精准的模型,或者一个泛化能力更强的模型。然后你再思考通过 RAG 增强训练的最佳形式、定义要消费的数据结构、打磨消费这些数据的提示词,以及其他种种「魔法」。随着时间推移,在解决业务问题的尝试中你会发现:要「调」的变量太多了,而且你常常不知道一次改动会如何全局性地影响模型处理信息的方式 — 在这些定制中建立因果关联非常困难。

为了解决这个问题,出现了一批工具,让你能看清模型得出某个回答所走过的「推理树」:比如它是否消费了来自专门知识库的信息;如果是,来自哪个向量库、是哪个 blob(向量信息小块);甚至调用了哪个外部 API — 这一切都是实时的。这套工具对微调帮助极大!对已经习惯传统应用调试的人来说,学习过程相当轻松。

如今可用的选项中,有 LangSmith — 它与 LangChain 同属一个开源框架,因此是我的最爱,因为它属于硅谷最重要的语言模型开源工具生态;还有 LangFuseLunary。附注:LangSmith 这个名字不是白起的 — 看过《黑客帝国》的人懂我在说什么。区别在于,这里的特工(Agent)揭示矩阵的信息,而不是保护它。玩笑归玩笑,这些工具让我们像调试传统软件一样调试生成式 AI 应用。它们呈现子调用数据、延迟时间、调用成本,以及你在生成式 AI 应用中自定义的事件追踪/标签。它同样是生产环境监控的利器 — 无论是错误检测还是使用统计。

且慢,这些工具的真正价值是什么?

关于 LLM,有许多东西从纯数字视角观察并不直观,因此通过用户界面看到可视化会很有用(例如温度参数如何影响模型的输出分布)。我个人认为,一个精心打磨的用户界面确实能加速原型开发与日常工作 — 全靠代码来做往往很繁琐。此外,能够可视化 LLM 系统正在经历的过程和一条复杂的命令链,对理解「为什么得到了现在这个结果」大有裨益。当你构建越来越复杂的工作流时,很难弄清到底哪些查询流经了哪些分支,所以一个能看到这些并记录历史数据的简单界面,从第一天起就是增值项。

谁在与 LangSmith 竞争?

虽然目前还没有直接竞争者,但对 Vercel(拥有 AI SDK)这类组织来说,在自己的平台上构建类似功能非常合理 — 毕竟它们想成为 GenAI 应用创作者的大本营。考虑到这类工具的市场潜力,我预计其他平台会在未来 3-6 个月内构建类似工具。

尽管 LangSmith 目前似乎还没深入 Embeddings/向量存储,但这类功能与许多以自带 UI 为差异化的 Embeddings/向量存储供应商之间存在天然的巨大交集。像 LlamaIndex 这样的生态会受益于这类产品演进,但尚不清楚它们能否长期保持差异化,因为问题空间看起来非常相似。即便如此,LangSmith 仍希望连接尽可能多的工具,这是好事。

长期差异化需要什么?

我对 LangSmith 感到兴奋,所以才花时间写下这些。我认为它解决了开发者和创作者走向生产环境时面对的多个真实问题。长期的真正问题依然是:「这里的东西足以构建一门长期可防御的生意吗?」

我没有水晶球(意外吧),但我今天的总体判断是:LangSmith 当前的许多功能对开发者来说是基础能力,大多数 LLM 供应商迟早会在自家平台上构建类似功能。但这不意味着 LangSmith 不能成功。看看 HashiCorp 的 Terraform:它是嵌在所有云供应商之间的胶水,解决的问题大到足以支撑一家上市公司。不过 LangSmith 需要持续扩展边界,才能与多家供应商及其他工具生态竞争 — 而它已有天然优势!它出自 LangChain 同一批开发者之手,而 LangChain 是当今创建与部署生成式 AI 应用使用最广的库。前景不错!

结论:LLM 的个性化是一门涉及众多挑战与变量的复杂艺术。 LangSmith、LangFuse、Lunary 这类工具作为简化这一过程的关键方案出现,提供直观的用户界面,让模型更可视、更可理解。凭借实时调试与监控支持,这些工具不仅简化了开发与生产,还从一开始就提供显著价值,帮助开发者优化工作流、更高效地解决问题。

这些工具的未来看起来很有前途,尤其是在 LangChain 这样的开源生态中的集成与协作。尽管存在潜在竞争和与其他新兴方案的功能相似性,LangSmith 及其对手仍有机会通过持续创新和能力扩展确立领导地位。凭借坚实的基础和不断成长的社区,这些工具已就位,将参与定义 LLM 与生成式 AI 开发的未来。 🚀

评论 (0)

  • 还没有评论。来做第一个吧!

评论是公开的。

继续阅读

欧洲眨眼了:AI 法案的推迟,以及它给 PL 2338 的启示

程序化点击的终结:RPA、自主智能体,以及争夺企业自动化心脏的静默之战

记忆即基础设施:多智能体架构中的持久上下文如何重新定义客户服务

生成式 AI SaaS 产品定价:一个新的市场范式

Agent2Agent(谷歌)与 Model Context Protocol(MCP):智能体互联与 API 集成的架构性进化答案

在生成式 AI 智能体框架与 RPA 遗留系统之间求平衡

各位同仁,进化在路上 — Titans 架构:Transformer 潜在的进化替代方案

「广域上下文感知」:LLM 打造真正解决问题、理解客户的数字客服的潜力

用 LLM 做数据转换(ETL):Data Lake 项目的新思路

产品管理的未来:最新最有前景的 GenAI 无代码工具

Hugging Face — GenAI 数据科学家的游乐场

面向生成式 AI 的多源图谱数据分析架构

GenAI 的云基础设施 — 自动化与 RPA

第一代 LLM 构建工作室产品 — SaaS — FlowiseAI

开源:巴西技术创新危机的一条出路 — 一份公开宣言

营销与生成式 AI — 让对话产品更有创造力的假设与实验

Embeddings — 与你的数据对话的强大工具

微调对比 Embedding — 一个面向教育的产品用例

思考「AI 驱动」的产品团队 — 链式调用、伦理及其他

AI 现在会写代码了。对企业而言,这既是好事也是坏事。

Marketing LaB — 「对话式数字」时代的几个假设

RPA 技术对决多模态模型 — 这场变革将如何发生?

在巴西,LLM/GPT 的变革与落地会以怎样的速度、以怎样的方式发生?

基础模型与商业的未来

AI 时代已经开始