al-Qantara
全部文章

各位同仁,进化在路上 — Titans 架构:Transformer 潜在的进化替代方案

Lipie Souza2025年1月21日阅读约 1 分钟0 次浏览

分享
WhatsApp

本文由葡萄牙语原文自动翻译。阅读原文

如果呢?

关于基于 Transformer 结构及其现代注意力机制的语言模型,其「认知能力」还能进步到什么程度,讨论已经很多。数学推理、编程和事实性知识等自动化测试的结果,似乎趋向停滞。一些假说认为这项技术的现有特性可能受制于几个因素:其一是训练所用的数据量;另一些人押注神经网络的参数量可能是限制因素;还有一个 — 我最喜欢的假说:这些模型的训练架构本身就受制于学习损失。且听我细说!

先弱化前两个假说的影响:

1. 有些模型使用的数据集比其他模型小,却在多项认知评估中表现更好。这让我想到:训练数据量或许不是限制因素,质量与多样性的影响可能更大。此外,公开数据的可得性本身也会成为限制(尽管会随时间增长):

Epoch AI 的完整研究见此。

Epoch AI 的完整研究见此。

2. 有些模型的神经网络参数量比其他模型少,表现却接近大模型。因此可以说两者不存在线性相关 — 尽管参数多确实可能是优势。就像我们在大学里学到的(计算机专业的同学懂),也许这只是「蛮力」。

2025 年前主要模型的 MMLU 与参数量对比。

2025 年前主要模型的 MMLU 与参数量对比。

现在回到我最钟爱的假说(也是很多人的心头好):真正限制这场游戏的,是 Transformer 的架构 — Transformer 学得很差!它们有记忆,但只是短期记忆;从最初的训练「轮次」(Época)到最后的轮次之间,太多东西被丢掉了。结果是一个过于泛化的模型统计上连贯,但在各轮学习之间建立关联时却有点**「笨」。**

Transformer 的结构借助不同数据集的迭代实现记忆概念,通过更新权重来兼顾当前与过去的上下文。但简化来说,这种方法的产出趋向于各次迭代之间的一个平均值。因此,得到的记忆是短暂的。

Titans 结构提出了几种机制,命名为「Memory as a Gate(MAG)」、「Memory as a Context(MAC)」和「Memory as Layer(MAL)」,它们把长期记忆用作任何未来迭代(轮次)在测试时的情境上下文/参照。MAG 如下:

「Memory as a Gate(MAG)」— Titans 结构提出的机制。

「Memory as a Gate(MAG)」— Titans 结构提出的机制。

**这个提案的最大「AHA」在于:把很久以前学到的东西记牢,这些模型就学得更好。啊哈,而且它们还很擅长忘掉那些过于泛化的东西!**结果是收益不大但前景可期:研究显示困惑度(perplexity)下降 — 即无监督训练的模型在给定训练中用过的字符串/信息时,泛化预测下一串 token 的能力;在使用独立数据集保证有监督连贯性时,准确率也有提升。谷歌研究团队发表的完整论文在这里。以下是这项研究的部分结果:

Titans 对比 Transformer 及其他语言学习架构。

Titans 对比 Transformer 及其他语言学习架构。

许多研究者期待 Titans 结构因此成为 LLM 训练框架的下一个押注。也许正是本文所述三大支柱的共同进化,才会带来「认知上越来越聪明」的 AI — 但我重注押在:学习架构才是最大的变数。有意思的是,这项研究的三位作者不断类比我们人类的学习方式,大量引用心理学领域的研究 — 人类学习依然是改进这些东西学习方式的最大灵感来源。我们会被超越,至少在数学上。**在神经元数量和信息获取上,我们已经「输了」!**我们要做的是重塑自己 — 诗意地、音乐地、艺术地 — 让这些东西去完成它们的逻辑工作。没有任何否认或幻想能让我们逃避这个现实:人生总有输的时刻,某一刻它就是会发生。但之后我们会再赢回来……毁掉我们的不是我们自己创造的造物,而是我们丧失了重塑事物的能力!各位同仁,"The future is awesome"。重塑自己吧 💣💥🏋

评论 (0)

  • 还没有评论。来做第一个吧!

评论是公开的。

继续阅读

欧洲眨眼了:AI 法案的推迟,以及它给 PL 2338 的启示

程序化点击的终结:RPA、自主智能体,以及争夺企业自动化心脏的静默之战

记忆即基础设施:多智能体架构中的持久上下文如何重新定义客户服务

生成式 AI SaaS 产品定价:一个新的市场范式

Agent2Agent(谷歌)与 Model Context Protocol(MCP):智能体互联与 API 集成的架构性进化答案

在生成式 AI 智能体框架与 RPA 遗留系统之间求平衡

「广域上下文感知」:LLM 打造真正解决问题、理解客户的数字客服的潜力

LangSmith — 如何看清 LLM 的「推理」脉络,以改进你的微调?

用 LLM 做数据转换(ETL):Data Lake 项目的新思路

产品管理的未来:最新最有前景的 GenAI 无代码工具

Hugging Face — GenAI 数据科学家的游乐场

面向生成式 AI 的多源图谱数据分析架构

GenAI 的云基础设施 — 自动化与 RPA

第一代 LLM 构建工作室产品 — SaaS — FlowiseAI

开源:巴西技术创新危机的一条出路 — 一份公开宣言

营销与生成式 AI — 让对话产品更有创造力的假设与实验

Embeddings — 与你的数据对话的强大工具

微调对比 Embedding — 一个面向教育的产品用例

思考「AI 驱动」的产品团队 — 链式调用、伦理及其他

AI 现在会写代码了。对企业而言,这既是好事也是坏事。

Marketing LaB — 「对话式数字」时代的几个假设

RPA 技术对决多模态模型 — 这场变革将如何发生?

在巴西,LLM/GPT 的变革与落地会以怎样的速度、以怎样的方式发生?

基础模型与商业的未来

AI 时代已经开始