写在前面

很多人觉得AI是2023年ChatGPT火了之后才有的东西。其实不是。

AI这个词,1956年就有了。比你爸的年纪都大。

但为什么前60年你没啥感觉,最近几年突然就“爆发”了?这中间发生了什么?搞清楚这条线,你就能理解AI今天为什么是这个样子,也能判断它明天大概会往哪走。

咱们用大白话,把这条70年的路捋一遍。


一、1950年代:一个天才的问题

1. 图灵和他的“模仿游戏”

1950年,英国有个数学家叫艾伦·图灵(Alan Turing),就是电影《模仿游戏》里破译德国密码那位。

他问了一个特别朴素的问题:

“机器能思考吗?”

这个问题听起来简单,但极难回答。因为“思考”这个东西,你自己都说不清楚是什么。

图灵很聪明,他不说“思考”了,换个说法:如果你跟一个机器聊天,聊了半天分不清它是人还是机器,那就算它能“思考”了。 这就是著名的图灵测试

用大白话说就是:蒙上眼睛聊微信,分不清对面是人是狗,那这狗就算“聪明”。

这个测试到今天还在被讨论,虽然现在的大模型很容易就“骗”过人类了,但图灵提出这个问题的1950年,连计算机都还没几个人见过。

2. 1956年:AI这个词正式诞生

1956年夏天,美国达特茅斯学院开了个会。

这个会搁今天就是个“学术研讨会”,但放到历史上,它是AI的生日派对

会上,一群年轻学者(约翰·麦卡锡、马文·明斯基、克劳德·香农等)第一次正式用了**“Artificial Intelligence”**这个词,翻译过来就是“人工智能”。

他们当时特别乐观,觉得:人类智能无非就是一些信息处理过程嘛,用计算机模拟一下,20年内搞出来跟人一样聪明的机器没问题!

后来的事实证明,他们太天真了。但这份乐观也不是没道理——那时候计算机刚发明没多久,什么都是新鲜的,什么看起来都有可能。

这一阶段的关键词:概念诞生、极度乐观

大白话总结:一群聪明人聚在一起,给“让机器变聪明”这件事起了个名字,然后信心满满地开干了。


二、1960-1970年代:第一次热潮与第一次寒冬

1. 专家系统:让机器当“老中医”

60年代到70年代,AI的主流路线是专家系统

什么是专家系统?打个比方:

你去老中医那看病,老中医问你“哪里不舒服”,你说“头疼”,他问“疼了多久”,你说“三天”,他一摸脉说“上火,开副清热泻火的药”。

专家系统就是把这个过程写成规则,让计算机执行。 你输入症状,它查规则库,输出诊断结果。

听起来很合理对吧?而且早期效果确实不错。有一个叫MYCIN的系统,专门诊断细菌感染,准确率比一些年轻医生还高。

2. 但问题来了

专家系统有个致命缺陷:规则是人一条一条写的。

你想让它诊断10种病,写10条规则就行。想让它诊断1000种病?写1000条。10000种呢?写到你退休都写不完。

而且真实世界的复杂度远超想象。光是一个“头疼”的病因就有几十种,规则之间还会互相冲突。写到后面,规则库变成一个巨大的怪物,改一条就出bug,根本维护不了。

更别提那些说不清道不明的经验了。老中医号脉那种手感,你怎么写成规则?

3. 第一次AI寒冬

到了70年代中后期,大家发现AI离“20年内造出跟人一样聪明的机器”差了十万八千里。美国政府一看,投了这么多钱没啥产出,砍经费

学术圈发不出论文,工业界裁项目,媒体也不报了。这就是第一次AI寒冬

这一阶段的关键词:规则驱动、专家系统、寒冬

大白话总结:让机器靠“人写的规则”来模拟智能,简单场景行,复杂场景崩了。大家发现AI没想象中那么容易,钱撤了,人散了。


三、1980-1990年代:机器学习崛起与第二次寒冬

1. 换个思路:别写规则了,让机器自己学

寒冬之后,有人反思:专家系统为什么不行?因为它靠人写规则,人写不过来。

那换个思路:能不能让机器自己从数据里学规律?

这就是机器学习(Machine Learning)的核心思想。

打个比方:

  • 专家系统的做法:你告诉机器“红色的苹果是甜的,绿色的苹果是酸的”——你把规则写死
  • 机器学习的做法:你给机器看1000个苹果,告诉它哪些甜哪些酸,让它自己找规律——它学会了自己判断

这就像教小孩:

  • 前者是死记硬背,你告诉他“1+1=2”,他就只会算1+1
  • 后者是举一反三,你给他看一堆例子,他自己悟出了加法规律

机器学习不需要你写规则,它自己从数据里挖规则。 这一下就解决了专家系统“规则写不过来”的问题。

2. 神经网络也冒头了

在这个时期,神经网络(Neural Network)的概念也开始受到关注。

神经网络模仿人脑神经元的结构:很多个“神经元”连成网,输入数据,层层传递,最终输出结果。

但当时的神经网络很“浅”——只有一两层,而且算力不够、数据不够,效果一般。所以大家也只是“关注”,没有真正爆发的条件。

3. 第二次AI寒冬

80年代末到90年代初,AI又经历了一次寒冬。这次的原因更具体:

  • 神经网络虽好,但受限于当时的算力数据量,效果上不去
  • 一些过度宣传的项目(比如日本的“第五代计算机”计划)没兑现承诺
  • 经费又砍了,又冷了

这一阶段的关键词:机器学习萌芽、神经网络初现、又一次寒冬

大白话总结:大家发现“让机器自己学”比“手写规则”靠谱,但当时的硬件和数据撑不起这个想法,所以又凉了一阵。方向对了,但条件不成熟。


四、2000-2010年代:三大条件齐备,深度学习爆发

1. 三件事凑齐了

AI前两次爆发都失败了,第三次为什么成了?因为三个关键条件终于凑齐了:

条件 以前的情况 2010年前后 大白话
数据 数据少,互联网没普及 移动互联网爆发,数据多到爆炸 以前喂猫的只有几张照片,现在网上猫图几亿张
算力 CPU算力不够,跑不动复杂模型 GPU被用来做AI计算,速度快了几百倍 以前骑自行车,现在换跑车了
算法 神经网络太浅,效果一般 深度学习算法成熟,层数能堆很深 以前只会一招,现在学会组合拳了

数据、算力、算法——AI的三驾马车,前两趟出发都因为缺轮子趴窝了,这次三个轮子终于凑齐了。

2. 2012年:AlexNet一战封神

2012年有一个标志性事件。

每年有一个ImageNet图像识别比赛,参赛的AI系统要比谁认图片认得准。2012年之前,最好成绩的错误率在25%左右(四张图认错一张)。

2012年,一个叫AlexNet的系统参赛,用了深度卷积神经网络,错误率直接干到15.3%——比上一年冠军提升了10个百分点。

这是什么概念?相当于百米赛跑,别人都在10秒附近挤来挤去,突然有人跑进了9秒。整个学术界震动了。

从这一刻起,深度学习(Deep Learning)彻底成为AI的主流。

3. 深度学习的黄金时代(2012-2017)

接下来的几年,深度学习在各个领域疯狂刷榜:

  • 图像识别:ResNet(2015)错误率降到3.5%,比人眼还准
  • 语音识别:错误率大幅下降,Siri、小爱同学成为可能
  • 自然语言处理:机器翻译质量飞跃,Google翻译大升级
  • 游戏AI:AlphaGo(2016)4:1击败李世石,举世哗然

但这个时期有一个隐含的问题:每种任务都需要专门训练一个模型。 识别图片的模型不会翻译,会翻译的模型不会下棋。每个任务从零开始训,成本极高。

这一阶段的关键词:深度学习爆发、算力+数据+算法三件套、专用模型

大白话总结:硬件和数据的条件终于成熟了,深度学习像开了挂一样在图像、语音、翻译领域疯狂刷成绩。但每个任务还得专门训练一个模型,不够通用。


五、2017年至今:Transformer革命与大模型时代

1. 2017年:一篇论文改变一切

2017年,Google发表了一篇论文,叫**“Attention Is All You Need”**(你只需要注意力机制就够了)。

这篇论文提出了一个全新的架构——Transformer

在Transformer之前,处理文本的AI是“一个字一个字读”的(RNN/LSTM),读到后面忘了前面。Transformer不一样,它一次性看全部内容,还能自动判断哪些部分更重要——这就是“注意力”(Attention)的意思。

打个比方:

  • RNN像一个人逐字逐句读文章,读到结尾已经忘了开头
  • Transformer像一个人一目十行扫完全文,还自动高亮了重点

这个架构太强了,强到后来所有的大模型都是基于它构建的。GPT、BERT、LLaMA、Qwen……全是Transformer家族的。

2. 2018-2020:预训练时代的开启

Transformer出现后,AI界发现了一个新玩法——预训练(Pre-training)。

以前的深度学习是“为每个任务单独训模型”。预训练不一样,它分两步:

  1. 预训练:先拿海量文本让模型“博览群书”,学会语言的基本规律(这步超贵,要几百万美元)
  2. 微调:再针对具体任务“短期培训”一下就能用了(这步便宜多了)

这就像:先读个大学打好基础(预训练),再去公司实习几天就能上手具体工作(微调)。不用每个岗位都从小学开始念。

2018年Google的BERT和OpenAI的GPT几乎同时发布,都基于Transformer,都用了预训练,效果吊打之前的模型。

3. 2022年11月30日:ChatGPT的诞生

这是AI历史上最重要的日期之一。

2022年11月30日,OpenAI发布了ChatGPT

其实ChatGPT用的技术(GPT-3.5 + RLHF人类反馈强化学习)并不算全新,但它的效果震惊了所有人:

  • 你可以用自然语言跟它聊天,它真的“懂”你在说什么
  • 你让它写代码、写文章、翻译、做数学题,它都能答个七七八八
  • 关键是,它免费、公开、谁都能用

5天用户破百万,2个月月活过亿——这是人类历史上增长最快的消费级产品。

ChatGPT的爆火不只是一个产品的成功,它证明了一件事:大模型可以“通用地”解决各种问题,不需要每个任务都单独训模型了。 一个模型,什么都能聊两句。这在AI历史上是第一次。

4. 2023年至今:百模大战与Agent时代

ChatGPT之后,一切都加速了:

  • 闭源大模型:GPT-4、Claude、Gemini不断刷新能力上限
  • 开源大模型:LLaMA、Qwen、ChatGLM、Mistral迅速跟进,开源能力逼近闭源
  • 应用层爆发:RAG(检索增强生成)、Agent(智能体)、AI编程助手、AI绘画……各种应用层出不穷
  • 多模态:大模型从只能处理文字,进化到能看图、听声音、看视频

2024年开始,行业焦点逐渐从“模型能力”转向**“工程化落地”**——怎么把大模型真正用起来、用得起、用得好、不出事。这也是我们这个系列文章后半部分要重点讲的内容。

这一阶段的关键词:Transformer、预训练、ChatGPT、大模型、通用智能

大白话总结:一个叫Transformer的架构改变了一切。大模型不再是一个任务一个模型,而是一个模型什么都能干。ChatGPT让全世界看到了这个可能性,然后所有人都冲进来了。


六、一张图看完70年

为了帮你建立完整的时间线感知,咱们把这条70年的路画出来:

时间 事件 意义
1950 图灵提出“机器能否思考” AI的思想种子
1956 达特茅斯会议,AI正式命名 AI学科诞生
1960s-70s 专家系统兴起 第一次热潮
1974 第一次AI寒冬 规则路线碰壁
1980s 机器学习萌芽 从“写规则”到“学规律”
1987 第二次AI寒冬 算力数据不足
2006 “深度学习”概念提出 酝酿第三次爆发
2012 AlexNet赢ImageNet 深度学习一战封神
2016 AlphaGo击败李世石 AI出圈,全民关注
2017 Transformer论文发表 架构革命
2018 BERT和GPT发布 预训练时代开启
2022.11 ChatGPT发布 大模型时代正式到来
2023-至今 百模大战 + Agent + RAG 从“能用”到“好用”

七、这70年告诉我们什么?

回顾完这段历史,有三个教训特别值得记住:

教训一:AI的发展从来不是一帆风顺的

两次寒冬,每次都有人说“AI已死”。但每次寒冬之后,AI都以更强的姿态回来了。所以下次你再看到“AI泡沫要破”的言论,不用慌——泡沫会有,但技术不会倒退。

教训二:条件比想法重要

前两次AI热潮,想法都对,但数据不够、算力不够,就是做不出来。技术突破往往不是“突然想通了”,而是“条件终于凑齐了”。 这对今天的开发者也有启发:别追那些硬件撑不起来的炫酷方案,选技术要看你手上有什么牌。

教训三:通用性是终极追求

从专家系统(一个任务一套规则)到深度学习(一个任务一个模型)到大模型(一个模型干所有事),AI的发展方向越来越“通用”。这意味着未来的开发者不需要为每个业务训练模型,而是学会怎么“用好”通用大模型。 这也正是我们这个系列后续要讲的重点。


本章小结

要点 内容
AI不是新东西 从1956年算起,已经70年了
两次寒冬的原因 规则写不过来(第一次)、算力数据不够(第二次)
深度学习为什么爆发 数据+算力+算法三件套终于齐了
Transformer改变了什么 让模型能“一眼看全局”,奠定了大模型的基础
ChatGPT的意义 证明了“一个模型干所有事”是可行的,AI从实验室走向大众
对开发者的启示 未来不是“训练模型”,而是“用好模型”

下一章预告: 第2章「AI、机器学习、深度学习到底是什么关系」—— 很多人这三个词混着用,其实它们是“俄罗斯套娃”式的关系。下一章我们掰开揉碎讲清楚,保证你看完再也不会搞混。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐