游乐游手机版
首页/AI热点日报/热点详情

机器学习基础知识全攻略零基础教程

类型:热点整理2026-07-22
机器学习模型主要分为有监督学习与无监督学习两大类。有监督学习依据标注数据解决分类与回归问题,涵盖线性回归、逻辑回归、决策树及集成学习等方法;无监督学习则用于聚类与降维,如K-means、PCA等。

机器学习的世界,说复杂也复杂,说简单也简单。咱们今天不聊那些玄乎的概念,就实实在在盘一盘,主流模型到底分哪几类,各自又有什么看家本领。

说白了,目前市面上常见的模型,无非就是两条线:一条是有监督学习,一条是无监督学习。这个分法,基本就是看咱们手里的数据有没有“标准答案”。

1. 有监督学习

这条路的核心逻辑,就是“喂”给模型大量已有正确答案的数据,让它自己去琢磨输入和输出之间的规律。这个过程,本质上是在学习一个从X到Y的函数映射。

那么,它能解决什么问题?总结下来就两类:

  • 分类问题: 判断这个东西“是”或“不是”。比如,判断一张图片里是猫还是狗,判断一个人是否健康。输出结果通常是一个离散的类别标签。
  • 回归问题: 预测一个具体的数值。比如,预测明天最高温度是多少度,或者一个地区人的平均身高。输出结果是一个连续的实数。

另外,现在很火的集成学习,本质上也是一种有监督学习。它的想法很朴素:一个模型不够准,那我就把好几个相对简单的模型组合起来,大家伙儿一起投票或者取个平均值,结果往往就更靠谱了。

1.1 单模型

这是最基础、最直接的“单打独斗”式算法。

1.11 线性回归

线性回归的核心理念,简单到可以用一句话概括:用一条直线去拟合数据点之间的关系。如果只用一个自变量X去预测一个因变量Y,那就是一元线性回归;如果牵扯到两个或多个自变量,那就是多元线性回归了。

1.12 逻辑回归

名字里带个“回归”,但它干的却是分类的活儿。它专门用来研究当Y是一个定类数据时,X和Y之间的关系。比如Y是“愿意”和“不愿意”、“买”和“不买”,这种二分类问题,就是二元逻辑回归。如果Y有多个类别,比如“低、中、高”,那就是多分类逻辑回归。需要注意的是,这里的X可以是一个数值,也可以是一个类别,但如果X本身是类别,那就得先做一点“哑变量”处理。

1.13 Lasso

这个算法挺有意思,它可以看作是线性回归的“升级版”。它通过在模型里建立一个L1正则化项,来强制把一些不那么重要的特征的系数压缩到零。你没听错,就是直接变成零。这样一来,那些没用的特征就被自动剔除了,模型因此变得更简单,也有效防止了过拟合。在处理数据存在多重共线性的问题时,它是个不错的利器。

1.14 K近邻(KNN)

KNN的思路非常直观:物以类聚,人以群分。关键在于它做预测时的决策方式。

  • 分类时,它会看看离预测样本最近的K个邻居,然后采用“多数表决法”:这K个邻居里,哪个类别最多,就把预测样本归到哪个类。
  • 回归时,它会采用“平均法”:把这K个邻居的输出值取个平均值,作为最终的预测结果。

1.15 决策树

它的结构就像一棵倒着长的树,任何一个决策都可以看作是它内部节点上提出的一个问题。顺着这些“是或否”的问题一步步走下去,最终会抵达一片叶子。那这片叶子的内容就是你的答案了。如果是分类树,这片叶子给出的结果是它里面所有样本的众数(出现最多的类别);如果是回归树,给出的则是所有样本的平均值

1.16 BP神经网络

这可以说是深度学习的老祖宗了。它模仿了人脑神经元的连接方式,是一个多层的前馈网络。它的核心机制有两个阶段:先是信号前向传播,输入层到隐藏层再到输出层算出一个结果;然后看这个结果和正确答案差距有多大,再把这个误差反向传播回去,逐层调整网络的权重和偏置,让下一次预测更准。它靠的就是这种“误差逆传播”的方式来学习。

1.17 支持向量机(SVM)

SVM在处理小样本、高维数据时表现出色。它干的事很纯粹:在数据空间里找一个“超平面”,这个平面能把不同类别的数据分得最开。SVM回归(SVR)则是用类似的想法去拟合数据,它会把数据映射到高维空间,然后再找一个完美的回归线。

1.18 朴素贝叶斯

它的理论基础就是大名鼎鼎的贝叶斯定理:在已知某个事件发生的前提下,计算另一个事件发生的概率。它有一个简单的“小前提”:假设所有特征之间都是相互独立的。虽然这个假设在现实中很难完全成立,但这并不妨碍它在文本分类等领域表现出色。

1.2 集成学习

俗话说“三个臭皮匠,顶个诸葛亮”,集成学习就是这句话的完美实践。它不是用单个模型单打独斗,而是组合多个模型(通常被称为弱学习器)来共同决策。对于分类问题,通常用“投票法”;对于回归问题,则用“平均法”。主流的集成方法有三大家族:Bagging、Boosting和Stacking。今天我们重点聊前两个。

Boosting

Boosting的思想是“串行”的:先训练一个模型,然后重点关注它“做错”的样本,让下一个模型去“补强”这些错误。这样一层层叠加上去,最终得到一个强学习器。

1.21 GBDT

GBDT是Boosting家族的明星。它以CART回归树为基础,串行地训练一组树。每一棵树的目标,都是为了拟合前一轮所有树组合之后剩下的“残差”(也就是损失函数的负梯度方向)。最终把所有的树加起来,就得到一个强大的模型。它既可以做回归,套上Sigmoid或Softmax函数也能做分类。

1.22 AdaBoost

AdaBoost也是Boosting的一种。它的做法是:给每个弱学习器分配一个权重,表现好的(误差率低的)给个大权重,表现差的(误差率高的)给个小权重。最后把这些带有权重的模型结果组合起来,形成最终决策。

1.23 XGBoost

XGBoost可以说是GBDT的“加强版”。它之所以快、准、狠,是因为做了两大改进:第一,它在损失函数里加入了正则化项,防止过拟合;第二,它利用损失函数的二阶泰勒展开去拟合,比一阶的GBDT收敛更快、更精确。自2015年提出以来,它就成了各大竞赛和工业界的新宠。

1.24 LightGBM

LightGBM是XGBoost的另一种高效实现。它最大的创新在于引入了直方图算法,把连续的浮点特征离散化成若干个桶,然后基于这些桶去计算和寻找最优分割点。同时,它采用带深度限制的“按叶子生长”策略,而不是传统的“按层生长”,这使得它在训练速度和内存占用上都极具优势。

1.25 CatBoost

CatBoost主要解决的是处理类别型特征的痛点。它能够自动、高效地处理这些非数值特征,并且通过巧妙的算法设计,解决了传统GBDT在处理类别特征时容易出现的预测偏移问题,从而提升了模型的泛化能力。

Bagging

与Boosting的“串行”不同,Bagging采用的是“并行”思路。它通过有放回地随机抽样,从原始数据集中生成多个不同的子集,然后在每个子集上独立地训练一个模型,最后把所有模型的结果进行平均或投票。

1.26 随机森林

随机森林是Bagging的代表作。它在生成每棵决策树时,不仅对样本进行随机抽样,还会对特征进行随机抽样。这样每棵树都长得不一样,各有各的“想法”。最后,森林综合所有树的意见(分类用投票,回归用平均)。这种双重随机性,让随机森林的抗过拟合能力极强,用起来非常稳健。

1.27 Extra Trees

这个名字已经出卖了它的特点:极其随机的森林。它跟随机森林很像,但在“随机性”上走得更远。在构建每棵树的节点时,它干脆不计算最优切分点,而是直接随机选择一个特征和一个阈值进行分裂。这让它的计算速度更快,树的差异性也变得更大。

2. 无监督学习

跟有监督学习不同,无监督学习手里拿到的数据是没有标签的。就像给你一堆东西,不告诉你它们叫什么,你自己去发现它们之间有什么规律,谁跟谁长得像。

2.1 聚类

聚类干的事就是“物以类聚”。它把相似的样本自动划归到一个簇(cluster)里。和分类不同,在开始聚类之前,你并不知道会有几个簇,每个簇代表着什么。

2.11 K-means算法

这是最经典的聚类算法。它的核心思想是:先随机选定K个中心点,然后计算每个样本到这些中心点的距离,把样本归到离它最近的那个中心点所在的类里。然后,再重新计算每个类的中心点,如此反复迭代,直到中心点的位置不再变化。它与分层聚类这种按字段聚类的算法不同,K-means是按样本进行聚类的。

2.12 分层聚类

这种聚类方法会形成一个树状的层级结构。你可以选择“自底向上”地合并(凝聚法,比如AGNES),把每两个最相近的簇合并起来;也可以选择“自顶向下”地分裂(分裂法,比如DIANA),把一个大簇一步步拆分开。在实际应用中,凝聚法使用得更为普遍。

2.2 降维

降维的意思就是,在尽量不丢失核心信息的前提下,把数据的“维度”降下来。为什么需要降维?因为高维数据不仅计算量大,还容易产生“维度灾难”。降维主要通过两种方式实现:特征选择和特征提取。

2.21 PCA主成分分析

PCA属于特征提取。它的做法是把原来多个有一定相关性的指标,通过线性组合,重新生成一组新的、彼此不相关的“主成分”。它的目标是,用尽可能少的几个主成分,去解释原始数据中尽可能多的信息。说白了,就是把数据压缩一下,去掉冗余,抓住核心特征。

2.22 SVD奇异值分解

SVD是线性代数里的一个“大杀器”,在机器学习领域应用广泛。它不仅是PCA算法背后重要的数学工具,还大量应用于推荐系统、自然语言处理等领域,可以说是很多算法的基石。

2.23 LDA线性判别

LDA虽然名叫判别分析,但它也能用于降维。它的逻辑跟PCA不太一样。PCA希望让数据投影到方差最大的方向,而LDA希望找到一个投影方向,让投影过去之后,“同一个类”的样本尽量聚合、距离近,而“不同类”的样本尽量分开、距离远。这样一来,在新的低维空间里,各类数据的分辨度最高。

来源:https://m.elecfans.com/article/2413900.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。