各位同仁,进化在路上 — Titans 架构:Transformer 潜在的进化替代方案
Lipie Souza2025年1月21日阅读约 1 分钟0 次浏览
本文由葡萄牙语原文自动翻译。阅读原文
如果呢?
关于基于 Transformer 结构及其现代注意力机制的语言模型,其「认知能力」还能进步到什么程度,讨论已经很多。数学推理、编程和事实性知识等自动化测试的结果,似乎趋向停滞。一些假说认为这项技术的现有特性可能受制于几个因素:其一是训练所用的数据量;另一些人押注神经网络的参数量可能是限制因素;还有一个 — 我最喜欢的假说:这些模型的训练架构本身就受制于学习损失。且听我细说!
先弱化前两个假说的影响:
1. 有些模型使用的数据集比其他模型小,却在多项认知评估中表现更好。这让我想到:训练数据量或许不是限制因素,质量与多样性的影响可能更大。此外,公开数据的可得性本身也会成为限制(尽管会随时间增长):

Epoch AI 的完整研究见此。
2. 有些模型的神经网络参数量比其他模型少,表现却接近大模型。因此可以说两者不存在线性相关 — 尽管参数多确实可能是优势。就像我们在大学里学到的(计算机专业的同学懂),也许这只是「蛮力」。

2025 年前主要模型的 MMLU 与参数量对比。
现在回到我最钟爱的假说(也是很多人的心头好):真正限制这场游戏的,是 Transformer 的架构 — Transformer 学得很差!它们有记忆,但只是短期记忆;从最初的训练「轮次」(Época)到最后的轮次之间,太多东西被丢掉了。结果是一个过于泛化的模型。统计上连贯,但在各轮学习之间建立关联时却有点**「笨」。**
Transformer 的结构借助不同数据集的迭代实现记忆概念,通过更新权重来兼顾当前与过去的上下文。但简化来说,这种方法的产出趋向于各次迭代之间的一个平均值。因此,得到的记忆是短暂的。
Titans 结构提出了几种机制,命名为「Memory as a Gate(MAG)」、「Memory as a Context(MAC)」和「Memory as Layer(MAL)」,它们把长期记忆用作任何未来迭代(轮次)在测试时的情境上下文/参照。MAG 如下:

「Memory as a Gate(MAG)」— Titans 结构提出的机制。
**这个提案的最大「AHA」在于:把很久以前学到的东西记牢,这些模型就学得更好。啊哈,而且它们还很擅长忘掉那些过于泛化的东西!**结果是收益不大但前景可期:研究显示困惑度(perplexity)下降 — 即无监督训练的模型在给定训练中用过的字符串/信息时,泛化预测下一串 token 的能力;在使用独立数据集保证有监督连贯性时,准确率也有提升。谷歌研究团队发表的完整论文在这里。以下是这项研究的部分结果:

Titans 对比 Transformer 及其他语言学习架构。
许多研究者期待 Titans 结构因此成为 LLM 训练框架的下一个押注。也许正是本文所述三大支柱的共同进化,才会带来「认知上越来越聪明」的 AI — 但我重注押在:学习架构才是最大的变数。有意思的是,这项研究的三位作者不断类比我们人类的学习方式,大量引用心理学领域的研究 — 人类学习依然是改进这些东西学习方式的最大灵感来源。我们会被超越,至少在数学上。**在神经元数量和信息获取上,我们已经「输了」!**我们要做的是重塑自己 — 诗意地、音乐地、艺术地 — 让这些东西去完成它们的逻辑工作。没有任何否认或幻想能让我们逃避这个现实:人生总有输的时刻,某一刻它就是会发生。但之后我们会再赢回来……毁掉我们的不是我们自己创造的造物,而是我们丧失了重塑事物的能力!各位同仁,"The future is awesome"。重塑自己吧 💣💥🏋
评论 (0)
- 还没有评论。来做第一个吧!















