Skip to content

人工神经网络

人工神经网络(Artificial Neural Networks,简称 ANNs)的概念灵感来源于人脑中的神经网络结构和功能,尽管 ANNs 是一个大大简化的模型。人脑极其复杂。通过研究其基本处理单元(神经元,neurons)及其相互连接,科学家和工程师们开发出了可在数字计算机上实现的计算模型。典型的 ANNs 架构由相互连接的节点或“神经元”层组成。

一个基本的 ANNs 结构包括输入层(input layer)、一个或多个隐藏层(hidden layers)和一个输出层(output layer)。输入层接收来自外部世界的原始数据(特征,features)。例如,如果对数字手写图像进行分类,每个像素的强度都可以是一个输入。输出层产生网络的预测结果(例如,识别出的数字)。位于输入层和输出层之间的是隐藏层。这些层对数据进行转换,使网络能够学习复杂的模式和关系。每增加一个隐藏层都可以潜在地提高网络学习更抽象特征的能力,但同时也增加了训练网络的复杂性和过拟合(overfitting)的风险。

随着时间的推移,各种 ANNs 架构已被开发出来,每种都适用于不同类型的任务和数据。一些最具影响力和广泛使用的架构包括:

  • 前馈神经网络(Feedforward Neural Networks,FNNs)/ 多层感知机(Multilayer Perceptrons,MLPs):这是最简单的 ANNs 类型,信息单向流动,从输入层经过隐藏层流向输出层。它们用于处理结构化(表格)数据的回归(regression)和分类(classification)等任务。
  • 卷积神经网络(Convolutional Neural Networks,CNNs):专门设计用于处理网格状数据,如图像。CNNs 使用卷积层自动且自适应地学习特征的空间层次结构,使其在计算机视觉(computer vision)任务(如图像分类、目标检测和图像分割)中非常有效。
  • 循环神经网络(Recurrent Neural Networks,RNNs):设计用于处理序列数据,其中信息的顺序很重要,例如时间序列、文本或语音。RNNs 具有形成有向循环的连接,使其能够保持对过去输入的状态或“记忆”。长短期记忆网络(Long Short-Term Memory,LSTM)和门控循环单元(Gated Recurrent Unit,GRU)等变体解决了学习长程依赖关系中的挑战。
  • Transformer 模型:一种较新的架构,彻底改变了自然语言处理(Natural Language Processing,NLP)领域。Transformer 模型使用一种称为“自注意力”(self-attention)的机制来衡量输入数据不同部分的重要性,使其能够有效处理长序列并捕获复杂的上下文关系。它们现在也正应用于计算机视觉和其他领域。

每种架构都有其优势,并针对特定类型的问题进行了优化。在使用机器学习(ML)应用开发 ANNs 时,您可以选择现有的架构,对其进行调整,甚至根据您的特定需求设计自定义架构。选择通常取决于数据的性质和您旨在解决的任务。选择网络架构没有通用的指导原则;实验和领域知识通常起着关键作用。