1_机器学习
第一章 基础知识
第一节 整体流程
1.1.1 STEP1: 数据准备+预处理
- 如下是
scikit-learn自带的数据集
| 加载函数 | 数据集描述 | 任务类型 |
|---|---|---|
load_boston(*[, return_X_y]) |
加载并返还 boston 房价数据集(已弃用,将在后续版本移除) | 回归(单输出回归,预测房价中位数) |
load_iris(*[, return_X_y, as_frame]) |
加载并返还 iris 鸢尾花数据集 | 分类(三分类,多类别识别) |
load_diabetes(*[, return_X_y, as_frame]) |
加载并返还 diabetes 糖尿病数据集 | 回归(单输出回归,预测病情进展指标) |
load_digits(*[, n_class, return_X_y, as_frame]) |
加载并返还 digits 手写数字数据集 | 分类(十分类,图像识别/手写体识别) |
load_linnerud(*[, return_X_y, as_frame]) |
加载并返还 linnerud 体能训练数据集 | 回归(多输出回归,用生理指标预测多项运动能力) |
load_wine(*[, return_X_y, as_frame]) |
加载并返还 wine 葡萄酒数据集 | 分类(三分类,产地/品类判别) |
load_breast_cancer(*[, return_X_y, as_frame]) |
加载并返还 breast cancer wisconsin 乳腺癌数据集 | 分类(二分类,良恶性肿瘤判别) |
1.1.2 STEP2: 训练
1.1.3 STEP3: 模型评估
评价指标:
分类任务(定性):准确率、召回率(灵敏度)、特异性、相关系数
回归任务(定量):确定系数、均方差(MSE)、均方根误差(RMSE)
第二节 环境搭建
1.2.1
第三节 机器学习基本知识
1.3.1 数据集基础知识
- 特征空间: 把每个特征当作一根坐标轴,所有特征轴张成的空间。每个样本对应其中一个点(向量),同类别的点在该空间里聚成簇,分类就是在这个空间里找分界面。

1.3.2 研究哪些问题
- 有监督(监督学习): 分类, 回归
- 特点: 有类别标记
- 无监督: 聚类, 降维

1.3.3 分类问题
- 二分类: 只有positive和negative
- 多分类: 三种花识别, 手写文字识别, 人脸识别
- 多标签分类: 标签之间不互斥 + 概览和不=1
1.3.4 回归问题
- 线性回归: $y=kx+b$
- 多项式回归: $y=ax^2+bx+c$
- 逻辑回归(实际是分类): 为什么🤔不归到二分类呢? 回归有逼近的概念, 分类没有;

分类和回归的关系: 本质是一样的, 分类问题可以将回归离散化; 回归也能将分类问题连续化
第四节 分类
1.4.1 分类

- Title: 1_机器学习
- Author: 明廷盛
- Created at : 2026-09-19 06:48:10
- Updated at : 2026-09-19 14:43:00
- Link: https://blog.20040424.xyz/2026/09/19/🤖人工智能/1_机器学习/
- License: All Rights Reserved © 明廷盛

