Skip to content

生成式AI演进

生成式人工智能的演进:历史视角

Section titled “生成式人工智能的演进:历史视角”

不久前,智能手机的预测文本功能还令人惊叹。接着,像 Gmail 的智能回复 (Smart Reply) 这样利用机器学习快速响应的功能,预示着一个更智能的数字未来。这些早期创新是生成式人工智能 (Generative AI) 的萌芽形式。从那时起,特别是在过去十年中,生成式 AI 的发展显著加速,改变了人工智能的面貌。

生成式 AI 的历程是一个充满演进思想、算法和计算能力引人入胜的故事。让我们追溯 GenAI 是如何发展的:

早期概念与探索 (20世纪50年代 - 80年代)

Section titled “早期概念与探索 (20世纪50年代 - 80年代)”

20世纪50年代见证了 AI 作为概念的诞生。1950年,艾伦·图灵 (Alan Turing) 发表了具有开创性的论文《计算机器与智能》(Computing Machinery and Intelligence),探讨了机器智能的可能性,并提出了机器能否思考的问题。

1952年,英国计算机科学家克里斯托弗·斯特拉奇 (Christopher Strachey) 为 Ferranti Mark 1 计算机开发了一个能生成奇特情书的程序,这可以说是最早的文本生成软件之一。

1966年,MIT 教授约瑟夫·维岑鲍姆 (Joseph Weizenbaum) 创建了 ELIZA,这是一个早期的自然语言处理 (Natural Language Processing, NLP) 程序,它模拟与心理治疗师的对话,展示了基于规则的文本生成。

特里·温诺格拉德 (Terry Winograd) 的 SHRDLU 程序(在 MIT 开发,1968-1970年)展示了一个更复杂的自然语言理解 (Natural Language Understanding, NLU) 系统,能够在受限的“积木世界”环境中进行交互。

1980年,由迈克尔·托伊 (Michael Toy) 和格伦·威克曼 (Glenn Wichman) 开发的视频游戏 Rogue 开创了程序化内容生成 (Procedural Content Generation, PCG) 技术,用于动态创建新的游戏关卡,这是互动娱乐中早期的一种生成式内容形式。

神经网络复兴与基础模型 (20世纪80年代 - 2010年代初)

Section titled “神经网络复兴与基础模型 (20世纪80年代 - 2010年代初)”

1985年,犹大·珀尔 (Judea Pearl) 引入了贝叶斯网络 (Bayesian networks),为不确定性下的推理提供了正式框架,并建立了与生成方法相关的重要建模概念。

迈克尔·I·乔丹 (Michael I. Jordan) 1986年的工作,包括《序列顺序:一种并行分布式处理方法》(Serial order: A parallel distributed processing approach),为循环神经网络 (Recurrent Neural Networks, RNNs) 奠定了基础,RNNs 对于处理序列数据至关重要。

1989年,扬·勒昆 (Yann LeCun)、约书亚·本吉奥 (Yoshua Bengio) 等人展示了卷积神经网络 (Convolutional Neural Networks, CNNs) 在图像识别方面的强大能力,为后来的视觉生成模型奠定了基础。

2003年,约书亚·本吉奥 (Yoshua Bengio) 等人发表了论文《神经概率语言模型》(A Neural Probabilistic Language Model),提出使用前馈神经网络进行语言建模,这是迈向现代 LLMs 的重要一步。

2006年,李飞飞 (Fei-Fei Li) 启动了 ImageNet 项目,这是一个大规模视觉数据库,对于推动计算机视觉领域的深度学习发展(包括生成视觉模型)至关重要。

深度学习主导与 Transformer 革命 (2010年代中期 - 2020年)

Section titled “深度学习主导与 Transformer 革命 (2010年代中期 - 2020年)”

2012年,由亚历克斯·克里热夫斯基 (Alex Krizhevsky)、杰弗里·辛顿 (Geoffrey Hinton) 和伊利亚·苏茨克弗 (Ilya Sutskever) 开发的深度 CNN 架构 AlexNet 在 ImageNet 竞赛中取得了重大突破,催化了深度学习革命。

2014年,伊恩·古德费洛 (Ian Goodfellow) 及其同事引入了生成对抗网络 (Generative Adversarial Networks, GANs),这是一个新颖的框架,其中两个神经网络(一个生成器和一个判别器)相互竞争,从而生成高度真实的数据。同年,迪德里克·金马 (Diederik Kingma) 和马克斯·韦林 (Max Welling) 开发了变分自编码器 (Variational Autoencoders, VAEs),这是另一种基于贝叶斯推理的强大生成模型。

2015年,研究人员发表了论文《使用非平衡热力学进行深度无监督学习》(Deep Unsupervised Learning using Nonequilibrium Thermodynamics)(Sohl-Dickstein et al.),为扩散模型 (diffusion models) 奠定了早期基础,扩散模型是一类后来获得显著发展的生成模型。

2017年发生了一个关键时刻,Google 研究人员在论文《Attention Is All You Need》中引入了 Transformer 架构。这个基于自注意力机制的架构彻底改变了序列处理,并成为大多数现代大型语言模型 (LLMs) 的基础。

2018年,Google 发布了 BERT (Bidirectional Encoder Representations from Transformers),这是一个极具影响力的预训练 Transformer 模型。OpenAI 推出了 GPT-1,这是他们生成式预训练 Transformer 模型系列中的第一个。

大规模模型、扩散模型与多模态 (2020年代至今)

Section titled “大规模模型、扩散模型与多模态 (2020年代至今)”

2020年,OpenAI 发布了 GPT-3,这是一个规模更大、能力更强的语言模型,展示了卓越的少样本学习能力,并生成了高度连贯的类人文本。这标志着大规模生成模型的新纪元。

2020年代初也见证了扩散模型 (Diffusion Models) 的蓬勃发展和普及。在早期思想的基础上,DALL-E (OpenAI, 2021)、Imagen (Google, 2022) 和 Stable Diffusion (Stability AI, 2022) 等模型展示了惊人的能力,可以根据文本提示生成高保真图像。这些模型通过学习逆转一个渐进的去噪过程来工作。

2022年11月30日,OpenAI 推出了 ChatGPT,这是一个基于 GPT-3.5 架构的对话式 AI,使先进的生成式 AI 对全球公众开放,并引发了广泛的讨论和采用。

2023年3月,OpenAI 发布了 GPT-4,这是一个大型多模态模型 (multimodal model),表现出改进的推理能力、知识水平,并能够处理文本和图像输入。Google 也推进了其努力,发布了 Bard 聊天服务(最初基于 LaMDA),随后(2024年2月)将其重命名为 Gemini,这是一个强大的多模态模型家族。

当前的趋势指向越来越强大和通用的多模态模型,它们能够理解和生成跨不同数据类型(文本、图像、音频、视频)的内容,并持续关注提高模型效率、可控性和安全性。