Transformer 是什么:把注意力变成 AI 的发动机
Transformer 是什么
如果把今天的大模型比作一座城市,Transformer 就像它的道路、电网和调度系统。它不是某一个聊天机器人,也不是某个具体产品,而是一种神经网络架构。2017 年,Google 研究团队发表论文 Attention Is All You Need,提出用注意力机制取代过去常见的循环网络和卷积网络来处理序列数据。后来我们熟悉的 GPT、BERT、T5,以及许多图像、语音、多模态模型,都沿着这条路继续扩展。
所谓“序列”,可以理解为有顺序的一串东西:一句话里的词,一段代码里的符号,一段语音里的片段,甚至一张图片切成的小块。过去处理序列时,模型常常像人逐字读书一样,从左到右一步步看。这样做很自然,却有两个麻烦:前面的信息传到后面会变弱,训练时也不容易并行。Transformer 的关键变化是:它让序列里的每个位置都可以直接“看见”其他位置,再决定哪些信息更重要。
为什么 Attention 重要
Attention 可以翻译成注意力。它解决的问题很朴素:当模型理解一个词时,应该重点参考上下文里的哪些词?
比如“我把苹果放进包里,因为它太沉了”。这里的“它”更可能指“苹果”还是“包”?人类会根据语义和常识判断。模型也需要类似能力。Attention 做的事情,是为当前词和上下文中的其他词计算一组相关性分数,然后把更相关的信息加权汇总过来。相关性高的词权重大,相关性低的词权重小。
这并不意味着模型真的像人一样“有意识地注意”。它只是通过矩阵运算学习出一种可训练的关联方式。但这种方式非常有用:它让模型不必把长距离关系挤进一个狭窄的隐藏状态里,而是可以在需要时直接建立联系。翻译、摘要、问答、代码补全中那些隔了很远但彼此相关的信息,因此更容易被模型利用。
Self-Attention 的直观理解
Self-Attention 的“Self”指的是同一段输入内部彼此互看。可以想象一场圆桌会议:一句话里的每个词都是一位参会者。轮到某个词发言时,它会先听听其他词说了什么,再决定自己该表达什么含义。
技术上,每个词会被转换成向量,并生成三种角色:Query、Key、Value。Query 像“我正在寻找什么信息”,Key 像“我这里有什么特征”,Value 像“如果你需要我,我能提供什么内容”。模型用 Query 和 Key 算相似度,再按这个相似度混合 Value。这样,一个词的新表示就不只是它自己,还包含了上下文中相关词的信息。
Transformer 还会使用多头注意力。它不是只用一套视角看句子,而是同时用多套视角观察:有的头关注语法关系,有的头关注指代,有的头关注位置或搭配。单个注意力头未必能被简单解释,但多头组合起来,就给了模型更丰富的表达能力。
Encoder 和 Decoder 是什么关系
原始 Transformer 包含 Encoder 和 Decoder 两部分。Encoder 负责读懂输入,把一句话、一段文档或一串符号压成带上下文的表示;Decoder 负责根据这些表示一步步生成输出。机器翻译就是典型场景:Encoder 读中文,Decoder 生成英文。
后来不同任务发展出不同变体。BERT 主要使用 Encoder,适合理解类任务,比如分类、检索、抽取。GPT 主要使用 Decoder,并采用“只能看左边上下文”的方式生成下一个 Token,所以特别适合续写、对话和代码生成。今天你和大语言模型聊天时,背后常见的就是 Decoder-only Transformer。
这里也能和另一篇文章连起来看:LLM/GPT 是什么讲的是模型如何通过预测下一个 Token 学会语言能力,而 Transformer 解释的是这种能力常用的底层结构。
为什么适合大模型
Transformer 适合大模型,首先因为它容易并行训练。传统循环网络要按顺序处理文本,前一步没算完,后一步不好开始。Self-Attention 可以让一段文本的许多位置同时参与计算,更适合 GPU 和大规模集群。
其次,它有很强的扩展性。参数更多、数据更多、训练更久时,Transformer 往往能持续吸收信息,形成更强的语言、推理和迁移能力。它没有把知识写成一条条规则,而是把大量统计规律压进参数里:词语如何搭配,概念如何关联,代码结构如何展开,问题通常怎样被回答。
再次,它不只适用于文本。图片可以切成 patch,音频可以切成片段,视频可以切成时空块,这些都能变成“序列”。所以 Transformer 从自然语言处理扩展到视觉、多模态和科学计算,并不意外。
局限与延伸
Transformer 很强,但不是魔法。Self-Attention 的计算量会随上下文长度快速增长,长文本、长视频、超大代码库都会带来成本压力。模型也并不真正理解事实本身,它学习的是数据中的模式,因此可能编造内容、延续偏见,或在看似流畅的回答里犯低级错误。
此外,Transformer 本身只负责建模和生成,不负责判断输出是否可靠,也不天然知道外部世界的最新状态。要让 AI 更可靠,通常还要结合检索增强、工具调用、权限控制、评测系统和人工复核。近年的稀疏注意力、长上下文、MoE、状态空间模型和多模态架构,都是在不同方向上补足它的成本、长度和能力边界。
理解 Transformer 的价值,不在于记住公式,而是看清一个事实:现代 AI 的飞跃,很大程度来自一种能高效建立上下文关系、又能被大规模训练放大的结构。