经典

一条时间线,串起 AI 从提出概念到走向通用能力的关键跃迁;一篇长文,聚焦 2017 年 Transformer 如何成为今天大模型的技术底座。

AI 发展脉络时间线:1956 达特茅斯会议、2012 AlexNet、2016 AlphaGo、2017 Transformer、2022 ChatGPT、2025 DeepSeek
AI HISTORY · 2017

Transformer:现代大模型的核心转折点

一篇2017年的论文,为什么最终改变了整个AI产业?

Attention Is All You Need Google · 2017 大模型时代的起点之一

如果说1956年的达特茅斯会议让“人工智能”成为一个正式的研究领域,2012年的AlexNet让深度学习重新成为产业主流,那么2017年的Transformer,则真正为今天的ChatGPT、Claude、Gemini、Llama以及DeepSeek铺设了共同的技术底座。

01|Transformer到底改变了什么?

2017年,Google研究团队发表论文《Attention Is All You Need》,提出Transformer架构。在它之前,处理语言最主流的方法是RNN、LSTM等循环神经网络。这些模型需要按照词语出现的顺序逐步处理信息:前一个词处理完,再处理下一个词。这意味着计算存在天然的串行瓶颈,而且句子越长,模型越容易出现长期依赖问题。

Transformer做了一个极其大胆的简化:不再依赖循环结构,而是把Attention作为核心。模型可以让一句话中的不同词彼此“关注”,直接计算它们之间的关系。例如理解“苹果发布了一款新手机”时,模型能够根据上下文判断“苹果”更可能指公司,而不是水果。这种机制让模型能够更灵活地捕捉远距离语义关系,同时更适合使用GPU进行大规模并行计算。

Transformer最重要的贡献,不只是“Attention”。真正重要的是:它让扩大模型规模、数据规模和计算规模成为现实。

02|为什么它成为大模型的技术底座?

Transformer出现以后,AI的发展路线开始发生变化。研究人员发现,如果把海量文本交给Transformer,让模型不断预测“下一个词”,它不仅能够学习语言规律,还会逐渐学到语法、知识、上下文关系,甚至一定程度上的推理与代码能力。

于是,一条后来改变整个产业的路线逐渐形成:Transformer + 海量数据 + 大规模算力 + 更大的模型。BERT证明了Transformer在语言理解上的巨大潜力;GPT系列则把“生成式预训练”一路推向更大的规模。到GPT-3时代,模型已经表现出明显的Few-shot能力——只需要少量示例,就能完成过去需要专门训练模型的任务。

03|从Transformer到ChatGPT

今天我们看到的ChatGPT,并不是突然出现的。它背后是一条持续了多年的技术链:

  • 2017 · Transformer
    Attention架构成为新的基础设施,解决了大规模语言建模的效率与扩展问题。
  • 2018 · BERT / GPT
    预训练范式逐渐成熟,模型开始先从海量数据中学习通用能力,再适配具体任务。
  • 2020 · GPT-3
    模型规模进一步扩大,Few-shot能力让“一个模型完成很多任务”成为现实。
  • 2022 · ChatGPT
    通过指令微调、RLHF等技术,大模型从“会生成文字”变成更像一个真正的AI助手。
  • 2025 · DeepSeek等
    模型架构、训练方法、推理效率和工程优化继续快速演进,大模型竞争进入效率与系统能力的新阶段。
Transformer真正开启的,不是一个新模型,而是一种新的AI生产方式: 用更大的数据、更大的模型和更多的计算,训练一个能够迁移到大量任务的通用模型。 —— 这是理解今天“大模型军备竞赛”的关键。

04|为什么说它是AI历史上的分水岭?

从产业角度看,Transformer带来的最大变化,是AI第一次拥有了高度通用的“基础模型”路径。过去,一个AI系统往往针对一个任务设计:翻译就是翻译、识图就是识图、下棋就是下棋。而大模型时代的逻辑完全不同:先训练一个规模巨大、能力通用的基础模型,再通过提示词、微调、工具调用、RAG和Agent等方式,让它适应不同业务。

这直接改变了AI产业的价值链。竞争不再只是“谁有一个更好的算法”,而逐渐变成谁拥有更好的模型、数据、算力、训练方法、推理效率、产品以及生态。从数据中心GPU,到云计算厂商,再到OpenAI、Anthropic、Google、Meta和DeepSeek,今天整个AI产业的技术路线,都能追溯到Transformer所打开的这条道路。

05|给普通人的一个结论

如果你不是算法工程师,完全没有必要把Transformer的每一个数学公式都吃透。但你必须理解它带来的范式变化:AI不再只是一个完成单一任务的软件,而开始变成一种可以通过训练获得通用能力的基础设施。

也正因为如此,今天我们讨论AI Agent、AI编程、AI销售、AI员工,本质上都不是凭空出现的新概念。它们建立在同一条技术演进线上:从“机器执行规则”,到“机器从数据学习”,再到“机器理解语言”,最终走向“机器能够理解目标并采取行动”。

2017年,Transformer解决的是“AI如何更好地理解上下文”。今天,整个产业正在继续追问:AI理解了之后,能不能真正替我们完成事情?
经典论文:Vaswani et al., Attention Is All You Need, 2017。
本页面为AI发展史科普整理版,重点在技术演进与产业影响,而非论文公式推导。