跳转至

机器学习概述

“机器学习,是赋予计算机无需被显式编程就能具备学习能力的研究领域。” ——亚瑟·塞缪尔

  • 依赖人为的特征工程
  • 输入结构化的数据(表格),非结构化数据(图片,文章)需要进行编码得到特征向量再输入

历史

基本概念

  • 样本Sample:数据集中的一条
  • 标签Label:需要预测的目标变量,可能给出或者不给出
  • 特征Feature:一个样本具有的信息维度
  • 数据标注:(人工)给无标签的数据集打上标签

面积 卧室数量 浴室数量 地段评分 房龄 二手 房价
85 2 1 6 15 0 180
110 3 1 7 8 0 320
142 4 2 9 3 0 510
73 2 1 4 20 1 100
128 3 2 8 5 0 450

这个例子里,房价就是标签,特征有6个(一般不包含标签) 其中“二手”这一特征是离散的

分类

按照学习方式

  • 监督学习:数据集带有标签
    • 回归Regression:给出数值类标签的预测
    • 分类Classification:给出离散型标签的预测
  • 无监督学习:数据集不含标签
    • 聚类Clustering:根据数据之间的相似度自动分组
    • 降维:将多个相关特征整合成一个,降低数据复杂度
    • 生成:生成与原始数据相似,但在现实中并不存在的全新数据点
  • 强化学习:智能体自己挖掘数据,重复探索-利用得到最优的策略
  • 深度学习:如果模型使用了很深的神经网络,则称作深度学习,可见[[DL概述]]

按照模型

模型 - 实现功能

  • 朴素贝叶斯:
  • 感知器Perceptrons:分类 [[感知器]]
  • 线性回归Linear Regression:回归