机器学习期末复习
目录
基础知识
1.学习过程中对某种假设的偏好称为归纳偏好
"奥卡姆剃刀"是一种常用的原则,"若有多个假设与观察一致,选择最简单的那个"
2.(1)过拟合,学习器把训练样本学习的太好,将训练样本本身的特点,当做所有样本的一般性质
导致泛化性能降低
(2)欠拟合 训练样本的一般性质未被学好
(3)过拟合的解决方案:降维,增加训练数据,正则约束
(4)欠拟合的产生原因:模型过于简单,未能捕捉到数据特征
(5)评估方法:留出法与交叉验证法,留一法
k折交叉验证:将数据集划分为k个大小相等的互斥子集,将其中k-1个子集作为训练集,余下的那个子集当做测试集
留出法:直接将数据集划分为两个互斥子集,尽量保持训练/测试集数据的平衡,进行若干次的随机划分,重复取平均值
留一法:每次取一个样本作为测试集,其余样本作为训练集,训练次数=样本个数.留一法的结果较为准确,但是数据集较大时,开销较大
3.性能度量:衡量模型泛化能力的评价标准
查准率,查全率(P-R)
P=TP/(TP + FP) R= TP/(TP + FN)
对学习器的预测结果按正例可能性大小排序,得P-R曲线
4.现实中不同类型的错误所造成的结果很有可能不同,为了权衡不同类型错误所造成的不同损失,可为错误赋予"非均等代价",在"非均等代价"下,ROC曲线不能直接映射出学习器的期望总体代价,而"代价曲线可以
5."偏差-方差分解"可以用来帮助解释泛化性能{
偏差表达了学习算法本事的拟合能力
方差表达了数据扰动所造成的影响
}
6.偏差-方差窘境,训练不足->学习器拟合能力不足->偏差主导泛化错误率->后期拟合能力提升->方差主导泛化错误率
7.线性判别分析
LDA也可被视为一种降维技术,因为它将样本投影到N-1维空间,N-1维的数据属性量远小于之前的LDA思想{
同类样例的摄影点尽可能接近
异类样例的摄影点尽可能远离
}
8.多分类问题的拆分策略
<->一对一,训练N(N - 1)/2个分类器,开销与测试时间大
训练只用两个类的样例,训练时间短
<>一对其余,训练N个分类器,开销与测试时间小
训练用到全部训练样例,训练时间长
<>多对多 最常使用ECOC码
决策树学习的目的是为了产生一颗泛化能力强,即处理未见示例能力强的决策树
属性划分:信息增益,增益率,基尼指数
剪枝:决策学习树学习算法对付"过拟合的主要手段",可以通过剪枝来避免因决策分支过多训练集自身的特点当做所有数据具有的一般性质,进而产生"过拟合"
预剪枝,决策树生成过程中,对每个节点在划分前进行先估计,若当前节点的划分不能带来决策树泛化性能的提升,则停止划分并将当前节点标记为叶节点,其类别标记为训练样例最多的类别
9.熵
对于离散随机变量x,假设其有M个取值,记pi=P(x=i),则熵定义为
![]()
对于连续变量x,假设其概率密度为F(x),则熵定义为
![]()
10.机器学习
机器学习是计算机科学与统计学结合的产物,主要研究如何选择统计学习模型,从大量已有数据中学习特定经验
机器学习中的经验称为模型,机器学习的过程即根据一定的性能度量准则对模型参数进行近似求解,以使得模型在面对新数据时能给出相应的指导
机器学习是一种通过先验信息来提升模型能力的方式
样本:数据集中每条记录是关于一个事件或对象的描述,称为样本
属性或特征:每个样本在某方面的表现或性质
特征向量:每个样本的特征对应的特征空间中的一个坐标向量
11.机器学习工作流程
1.获取数据 2.数据基本处理 3.特征方程 4.机器学习(模型训练) 5.模型评估
12.机器学习组成
三要素:数据,模型,性能度量准则
一线数据往往是"脏数据",可能包含大量缺失值,冗余值,而且量纲往往不同,需要特征方程对数据进行预处理
特征方程包括:特征构建,特征提取,特征选择
选择机器学习模型需要依赖数据和研究人员的经验
性能度量准则则用于指导模型进行模型参数求解,这一过程称为训练
训练的目的是使性能度量准则在给定数据集上达到最优
对大量参数反复调整或搜索的过程,称为调参
在训练之前调整设置的参数,称为超参数
13.分类问题和回归问题
根据模型预测输出的连续性,可将机器学习算法适配的问题分为分类问题和回归问题
分类问题以离散随机变量或离散随机变量的概率分布作为预测输出
回归问题以连续变量作为预测输出
在某些情况下,分类问题和回归问题可以相互转换
14.监督学习,半监督学习,无监督学习,强化学习
根据样本集合中是否包含标签以及包含标签的多少,可以将机器学习分为监督学习,半监督学习,无监督学习
强化学习:基于与环境的交互进行学习,输入数据直接反馈到模型,模型必须做出调整
无监督学习:降维,聚类等
半监督学习中没标识的数据的数量常常远大于有标识数据数量
15.模型评估
训练集用于调参,验证集用于验证挑选,辅助调参,测试集用于测试泛化能力
为了避免过拟合和欠拟合,通常需要做到数据量和模型复杂度的平衡,训练误差和测试误差的平衡
解决欠拟合:改进模型,设计新的模型重新训练,增加迭代次数
.解决过拟合:增加训练数据量,裁剪模型,正则化
基于数据的损失函数称为经验损失,正则化相称为结构损失
L1正则化较大概率得到"稀疏"解,起到特征选择的作用.L1正则化可能得到不止一个最优解
L2正则化的解更加平滑
L1,L2正则化都使参数尽可能的靠近零
16.Scikit-learn模型
加载数据集
from sklearn.datasets import load_iris
iris = load_iris()
x = iris.fata
y = iris.target
train_test_split
x_train,x_test,y_train,y_test = train_test_split(data,target)
test_size规定了测试集占数据集的比例,默认为0.25
shuffle规定了数据集是否被打乱,默认为True
17.机器学习描述一个概率分布时,在满足所有约束条件的情况下,熵最大的模型是最好的
18.线性模型
优化目标是让整个样本集合上的预测值和真实值之间的欧氏距离之和最小
![]()
线性回归模型存在唯一解
19.广义线性回归
逻辑回归属于概率线性回归
逻辑回归不能实现非线性回归
设样本x属于类别1的概率为p,则对数几率即ln(p/(1-p))
逻辑回归无法使用最小二乘法求解,可使用极大似然估计进行求解
model = LogisticRegression()
model.fit(X_train,y_train)
train_score = mdoel.score(X_train,y_train)
test_score = model.score(X_test,y_test)
20.评价指标
PR曲线,以precision为纵轴,recall为横轴
对二分类器,输出结果标签取决于置信度以及预定的置信度阈值
ROC曲线横轴为假阳率(FPR,False Positive Rate),纵轴为真阳率(TPR,True Positive Rate)
ROC曲线横轴为假阳率,纵轴为真阳率
当FPR = TPR 为对角线时,表示预测的正样本的结果一般是对的,一半是错的,为随机分类器的预测效果
希望ROC曲线尽量位于斜对角线以上,向左上角(0,1)凸
21.KNN
KNN不适合解决高维稀疏数据上的问题
KNN属于懒惰学习
KNN训练时间普遍较短
22.距离的度量
对于连续变量,一般使用欧式距离直接进行距离的度量
对于离散变量,可以先将离散变量连续化,然后再使用欧式距离进行度量
23.快速检索
计算到训练集中所有样本的距离加上排序的时间
24.决策树
每个非叶节点对应一个特征,每个叶子节点对应一个类别
25.特征选择
信息增益比:信息增益与数据集在该属性上的数据的熵之比
26.CART
以基尼指数作为特征选择指标
27.决策树剪枝
经验损失可以使每个叶节点上的样本分布的熵之和来描述,结构损伤可以用叶节点的个数来描述
试卷










更多推荐



所有评论(0)