游乐游手机版
首页/AI热点日报/热点详情

神经网络是什么?如何工作?与GPT有何关系?

类型:热点整理2026-07-21
程序员群体往往有一个显著的习惯,总想弄明白手头工具和中间件的底层逻辑。既然大家对技术原理始终抱有热情,我很想带大家重新认识一下AI模型的底层机制——尤其是GPT这类大语言模型,究竟是如何完成“思考”的。本文力求通俗易懂,特别适合零基础但对AI感兴趣的小伙伴阅读。 一、GPT 与神经网络的关系 GPT

程序员群体往往有一个显著的习惯,总想弄明白手头工具和中间件的底层逻辑。既然大家对技术原理始终抱有热情,我很想带大家重新认识一下AI模型的底层机制——尤其是GPT这类大语言模型,究竟是如何完成“思考”的。本文力求通俗易懂,特别适合零基础但对AI感兴趣的小伙伴阅读。

一、GPT 与神经网络的关系

GPT这个名字,如今几乎家喻户晓。我们每天都在与它互动:你抛出一个问题,它生成一段回答。但这个过程的内部究竟如何运作?中间那个黑盒子里到底藏着什么?大多数人其实并不清楚。

简单来说,GPT是一种基于神经网络的自然语言处理(NLP)模型。它的工作流程可以概括为:先用海量数据训练神经网络,反复调整参数,直到模型的输出符合预期。训练完成后,模型就能接收用户输入,并针对其中的关键信息给出经过“思考”的答案。那么,这个“思考”过程究竟如何?要理解它,还得从神经网络说起。

二、什么是神经网络

提到神经网络,脑海中首先浮现的是什么?大概率是人脑的神经网络。高中生物学告诉我们,人脑由数以亿计的神经元相互连接而成,每个神经元都有细胞体、树突、轴突,不同神经元之间通过突触连接,最终形成一个极其复杂的网络。

人工智能希望让人造机器接近人类的智力水平,自然会想到模仿人脑的运作模式。于是,一种模仿人脑神经元连接方式的计算模型诞生了——它也被称为神经网络。神经网络由多层神经元组成,每个神经元接收输入,经过计算后输出结果。这样说可能仍有些抽象,我们来看下面这张图,图中每个圆圈代表一个神经元。它们各自具备计算能力,计算出的结果会传递给下一个神经元。

生物学上存在一个规律:大脑结构越简单,智力水平就越低;神经系统越复杂,能处理的问题就越多样,智力自然也就越高。人工神经网络同样如此。越复杂的网络结构,计算能力就越强——这正是深度神经网络的价值所在。所谓“深度”,指的是网络中隐藏层的层数较多(可以看图中纵向结构),相比传统的浅层网络,它能处理更复杂的任务。

训练深度神经网络的过程,就是我们常说的深度学习。具体做法是:构建一个深度神经网络后,将大量训练数据输入进去,网络会自动学习数据中的特征。举个例子,如果要训练一个能识别猫的神经网络,只需喂给它大量不同品种、不同姿势、不同外观的猫图片。训练完成后,任意给它一张图片,它就能判断出其中是否有猫。

三、神经网络是如何计算的

了解了神经网络的基本结构,接下来要解决一个核心问题:神经元究竟如何对输入数据进行计算?

数据是如何输入到神经网络中的

这个问题,我们分两种情况来分析:图像数据与文本数据。

1、图像输入处理

想象一下,把一张图片不断放大,你会看到一个个小色块——这就是像素点。一张图的像素点越多,画面就越清晰。每个像素点只由一种颜色构成,而颜色由光学三原色(红、绿、蓝)按不同比例混合而成。在计算机的RGB模型里,每种颜色的强度用0到255之间的数值表示:0表示没有这种颜色的光,255表示强度达到最大值。对于一张256×256像素的图片,计算机需要用三个独立的256×256矩阵来存储这张图——分别对应红、绿、蓝。将这三个矩阵叠加在一起,图片就还原出来了。

那么如何把这种矩阵输入给神经网络呢?通常的做法是将这几个矩阵转换成一个向量。你可以把向量理解为一个1×n的数组(行向量)或n×1的数组(列向量)。对于256×256像素的图,这个向量的总维数就是256×256×3 = 196608。在AI领域,每次输入到神经网络的一个数据点,被称为一个“特征”。那么这张图就有196608个特征,这个196608维的向量也叫特征向量。神经网络就是依靠特征向量作为输入,进行预测,最后给出结果。

2、文本输入处理

文本是由一连串字符组成的,要输入给神经网络,必须先进行分词——将文本划分成有意义的单词。分词完成后,还要构建一个词汇表(将出现的所有单词或高频单词列出来,也可以直接使用现成的词汇表)。词汇表中的每个单词都被分配一个唯一索引,这样就将文本转换成了离散的符号序列,便于神经网络处理。正式输入之前,还会将这个符号序列转换为密集的向量表示。

举个例子,对于句子“How does neural network works?”:

  • 分词:["how", "does", "neural", "network", "works"]
  • 构建词汇表:{"how": 0, "does": 1, "neural": 2, "network": 3, "works": 4}
  • 序列化:["how", "does", "neural", "network", "works"] → [0, 1, 2, 3, 4]
  • 向量化(以 one-hot 为例):[[1, 0, 0, 0, 0], [0, 1, 0, 0, 0], [0, 0, 1, 0, 0], [0, 0, 0, 1, 0], [0, 0, 0, 0, 1]]

最后,将这个向量序列作为输入,交给神经网络进行训练或预测。到这里,数据的形式我们基本清楚了,可神经网络究竟是如何利用这些数据进行训练的呢?

神经网络是如何进行预测的

先厘清两个概念:训练和预测。训练是使用已知的数据集来调整模型参数,让模型学会输入与输出之间的映射关系;预测则是利用训练好的模型,对新数据做出推断。

神经网络的预测,其实基于一个很简单的线性变换公式:

这里,x是特征向量,w是特征向量的权重,表示每个输入特征的重要程度;b是阈值,影响预测结果。公式中的 dot() 表示向量相乘。

假如一个输入数据有 i 个特征,那么公式具体展开为:

该怎么理解这个公式?做个假设:周末要不要去公园划船,你拿不定主意,想让神经网络帮你做决定。决定去不去有三个因素:天气好不好、距离远不远、同行的人合不合心意。现在具体情况是:天气阴,偶有阵风;地点在20公里外的郊区;同行的是心仪已久的大帅哥。这三个因素就是输入的特征向量 x = [x1, x2, x3]。我们需要根据每个因素对结果的影响来设定特征值:天气不好、地点偏远是负面影响,设为 -1;和帅哥同行为正面影响,设为1。于是特征向量 x = [-1, -1, 1]。接下来要根据你的偏好来设置权重——也就是每个因素在你心里的重要程度。如果你不在乎天气和距离,只求与帅哥同行,那权重可以设为 w = [1, 1, 5];如果你比较懒,可能设为 w = [2, 6, 3]。总之,权重取决于你对对应特征的态度。

选择第一组权重 w = [1, 1, 5],特征向量 x = [-1, -1, 1],再设阈值 b = 1,并假设结果 z ≥ 0 就去,z < 0 就不去。那么预测结果:z = (x1w1 + x2w2 + x3*w3) + b = 4 > 0,所以神经网络给出的结论是:去公园划船。

刚才的公式:

本质上是一种逻辑回归,用来将输入数据映射到二分类的概率输出。逻辑回归通常会使用一个特定的激活函数,将 z 值映射到 [0, 1] 区间——这就是大名鼎鼎的 Sigmoid 函数。它的作用是将线性变换的结果通过非线性映射转换成概率值。通常情况下,概率大于等于0.5的被视为正类,小于0.5的归为负类。

Sigmoid 函数公式和图像如下:

除了将输出范围限制在0到1之间,Sigmoid 函数(以及其他激活函数)还有一个重要作用:对线性变换的结果进行非线性映射。这样一来,神经网络就能学习和表示复杂的非线性关系了。如果没有激活函数,网络再深也只能处理简单的线性问题;一旦加入激活函数,在层数足够多的情况下,它几乎能解决所有问题。因此激活函数是不可或缺的。

神经网络是如何进行学习的

得到预测结果后,神经网络并不会就此满足——它会通过损失函数来判断预测是否准确。如果不够准,它需要自我调整,这就是学习的过程。

损失函数用于衡量模型预测结果与真实标签之间的误差。将预测值与真实值对比,损失函数会给出一个数值指标,反映当前模型的预测性能。损失值越小,说明预测越接近真实;值越大,说明误差越大。下面介绍一个用于二分类问题的经典损失函数(对数损失):

神经网络学习的核心目标就是:调整模型参数,让损失函数的值降到最小,从而提升预测性能。这个过程就是模型的训练。梯度下降算法可以帮我们解决这个问题——通过梯度下降找到合适的 w(权重)和 b(阈值),它会有序地逐步改变 w 和 b 的值,让损失函数的结果越来越小,也就是让预测越来越精准。

这里有一个关键点:学习率的设置。如果学习率设得太小,需要很多次梯度下降才能到达最低点,浪费计算资源;如果设得太大,可能直接越过最低点,跳到图形左侧另一个位置,反而永远无法收敛到最优。所以需要根据实际情况选择合适的学习率。

总结一下,神经网络的计算过程主要包括两个步骤:正向传播和反向传播。正向传播用于计算神经元的输出——也就是前面提到的,对输入特征进行加权求和、再用激活函数做非线性变换的过程。反向传播则用于更新优化模型参数——通过计算损失函数关于模型参数的梯度,从输出层向输入层反向传播梯度。反向传播背后涉及大量数学运算,感兴趣的话可以深入研究。

四、综述

说了这么多,其实核心就一句话:神经网络训练和学习的过程,本质上就是不断优化模型参数、降低预测损失值的过程。经过充分训练后,模型能从输入数据中学习到有效的特征表示和权重分配,从而对未见过的数据做出准确预测。

训练完成的神经网络模型可以应用到各种实际问题中。在图像分类任务中,卷积神经网络可以根据输入图像的特征自动识别物体或图案;在自然语言处理任务中,循环神经网络能够理解和生成文本;在推荐系统里,多层感知机神经网络能根据用户历史行为进行个性化推荐。说到底,这一切的基础,就是我们今天聊的“神经网络”——那个藏在黑盒子里的奇妙机制。

来源:https://m.elecfans.com/article/2339567.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。