机器学习是一种利用数据让计算机自主发现规律的技术。本教程将从零基础出发,带你系统掌握机器学习的基本概念、核心任务、常见分类方法以及背后的哲学思考,帮助你快速构建完整的知识体系。
一、数据基础
机器学习的本质是向算法输入数据,让算法自动从数据中学习并找到映射关系。Iris鸢尾花数据集是一个经典范例,在统计学习和机器学习领域被广泛用作教学案例。该数据集包含3个类别共150条记录,每类50个样本,每条记录包含4个特征:花萼长度、花萼宽度、花瓣长度、花瓣宽度。利用这4个特征,可以预测鸢尾花属于(iris-setosa, iris-versicolour, iris-virginica)中的哪一个品种。

数据的整体称为数据集(dataset),其中每一行数据是一个样本(sample),除最后一列外,每一列代表样本的一个特征(feature),最后一列通常称为标记(label)。在鸢尾花数据集中,每个样本包含4个特征:萼片长度、萼片宽度、花瓣长度、花瓣宽度,每一行数据构成该样本的特征向量。所有特征向量所组成的空间称为特征空间(feature space),而分类任务本质上就是对特征空间进行划分。
特征可以非常具体,也可以非常抽象。例如在图像中,每个像素点都是一个特征,一张28×28的图像包含784个特征。因此,特征在很大程度上决定了算法结果的准确性和可靠性。这就是特征工程的重要性所在。
