机器学习概述¶
“机器学习,是赋予计算机无需被显式编程就能具备学习能力的研究领域。” ——亚瑟·塞缪尔
- 依赖人为的特征工程
- 输入结构化的数据(表格),非结构化数据(图片,文章)需要进行编码得到特征向量再输入
历史¶
略
基本概念¶
- 样本Sample:数据集中的一条
- 标签Label:需要预测的目标变量,可能给出或者不给出
- 特征Feature:一个样本具有的信息维度
- 数据标注:(人工)给无标签的数据集打上标签
| 面积 | 卧室数量 | 浴室数量 | 地段评分 | 房龄 | 二手 | 房价 |
|---|---|---|---|---|---|---|
| 85 | 2 | 1 | 6 | 15 | 0 | 180 |
| 110 | 3 | 1 | 7 | 8 | 0 | 320 |
| 142 | 4 | 2 | 9 | 3 | 0 | 510 |
| 73 | 2 | 1 | 4 | 20 | 1 | 100 |
| 128 | 3 | 2 | 8 | 5 | 0 | 450 |
这个例子里,房价就是标签,特征有6个(一般不包含标签) 其中“二手”这一特征是离散的
分类¶
按照学习方式¶
- 监督学习:数据集带有标签
- 回归Regression:给出数值类标签的预测
- 分类Classification:给出离散型标签的预测
- 无监督学习:数据集不含标签
- 聚类Clustering:根据数据之间的相似度自动分组
- 降维:将多个相关特征整合成一个,降低数据复杂度
- 生成:生成与原始数据相似,但在现实中并不存在的全新数据点
- 强化学习:智能体自己挖掘数据,重复探索-利用得到最优的策略
- 深度学习:如果模型使用了很深的神经网络,则称作深度学习,可见[[DL概述]]
按照模型¶
模型 - 实现功能
- 朴素贝叶斯:
- 感知器Perceptrons:分类 [[感知器]]
- 线性回归Linear Regression:回归