《Efficient Deep Learning Book》[EDL] Chapter 6 - Advanced Learning Techniques - Technical Review0 码力 | 31 页 | 4.03 MB | 2 年前3
Lecture 1: Overview0 码力 | 57 页 | 2.41 MB | 2 年前3
机器学习课程-温州大学-Scikit-learn## 机器学习-机器学习库Scikit-learn 黄海广 副教授 2022年01月 ## 本章目录 01 Scikit-learn概述 02 Scikit-learn主要用法 03 Scikit-learn案例 ### 1. Scikit-learn概述 01 Scikit-learn概述 02 Scikit-learn主要用法 03 Scikit-learn案例 ### Scikit-learn是基于NumPy、SciPy和Matplotlib的开源Python机器学习包,它封装了一系列数据预处理、机器学习算法、模型选择等工具,是数据分析师首选的机器学习工具包。 自2007年发布以来,scikit-learn已经成为Python重要的机器学习库了,scikit-learn简称sklearn,支持包括分类,回归,降维和聚类四大机器学习算法。还包括了特征提取,数据处理和模型评估三大模块。  ## 集成学习 ## Stacking 2. 易于并行化,在大数据集上有很大的优势; 3. 能够处理高维度数据,不用做特征选择。 ## 随机森林 Random Forest(随机森林)是 Bagging 的扩展变体,它在以决策树为基学习器构建 Bagging 集成的基础上,进一步在决策树的训练过程中引入了随机特征选择,因此可以概括随机森林包括四个部分: 1. 随机选择样本(放回抽样); 2. 随机选择特征; 3. 构建决策树;0 码力 | 50 页 | 2.03 MB | 2 年前3
机器学习课程-温州大学-05机器学习-机器学习实践## 机器学习-机器学习实践 黄海广 副教授 2022年02月 ## 本章目录 01 数据集划分 02 评价指标 03 正则化、偏差和方差 ### 1. 数据集划分 ## 01 数据集划分 02 评价指标 03 正则化、偏差和方差 ### 1. 数据集划分 训练集(Training Set):帮助我们训练模型,简单的说就是通过训练集的数据让我们确定拟合曲线的参数。 验证集(Validation > 三者划分:训练集、验证集、测试集 机器学习:60%,20%,20%;70%,10%,20% 深度学习:98%,1%,1%(假设百万条数据) ## 交叉验证  ## 不平衡数据的处理 数据不平衡是指数据集中各类样本数量不均衡的情况. 常用不平衡处理方法有采样和代价敏感学习 采样欠采样、过采样和综合采样的方法 训练集 验证集 测试集 0 码力 | 33 页 | 2.14 MB | 2 年前3
机器学习课程-温州大学-05深度学习-深度学习实践## 深度学习-深度学习实践 黄海广 副教授 2023年03月 ## 本章目录 01 数据集划分 02 数据集制作 03 数据归一化/标准化 04 正则化 05 偏差和方差 ## 数据集划分 训练集(Training Set):帮助我们训练模型,简单的说就是通过训练集的数据让我们确定拟合曲线的参数。 验证集(Validation Set):也叫做开发集(Dev Set),用来做模型选择(model selection),即做模型的最终优化及确定的,用来辅助我们的模型的构建,即训练超参数,可选; 测试集(Test Set):为了测试已经训练好的模型的精确度。 三者划分:训练集、验证集、测试集 机器学习:60%,20%,20%;70%,10%,20% 深度学习:98%,1%,1%(假设百万条数据) ## 交叉验证  def __getitem__(self, index): # 返回第index个数据样本 return self.data[index] 自定义一个继承自torch.utils.data.Dataset的类,在该类中实现___len___和___getitem___方法。 ## 过拟合和欠拟合  ✓ 如何预测上海浦东的房价? 代表特征的数量 x 代表特征/输入变量 y 代表目标变量/输出变量 $ (x,y) $ 代表训练集中的样本 $ (x^{(i)}, y^{(i)}) $ 代表第 i 个观察样本 h 代表学习算法的解决方案或函数也称为假设(hypothesis) $ \widehat{y} = h(x) $ , 代表预测的值 $ x^{(i)} $ 是特征矩阵中的第 i 行,是一个向量。 \cdots+w_{n}x_{n}\end{array} $$  机器学习算法 可以设 $ x_{0}=1 $ 则: $ h(x)=w_{0}x_{0}+w_{1}x_{1}+w_{2}x_{2}+\ldots+w_{n}x_{n}=w^{T}X $ 注意:若表达式0 码力 | 33 页 | 1.50 MB | 2 年前3
机器学习课程-温州大学-01机器学习-引言## 机器学习-引言 黄海广 副教授 2022年02月 ## 目录 01 机器学习概述 02 机器学习的类型 03 机器学习的背景知识 04 机器学习的开发流程 ### 1. 机器学习概述 01 机器学习概述 02 机器学习的类型 03 机器学习的背景知识 04 机器学习的开发流程 ## 机器学习与人工智能、深度学习的关系 人工智能:机器展现的人类智能 机器学习:计算机 机器学习:计算机利用已有的数据(经验),得出了某种模型,并利用此模型预测未来的一种方法。 深度学习:实现机器学习的一种技术  ## 机器学习界的执牛耳者  李航, 现任字节跳动科技有限公司人工智能实验室总监, 北京大学、南京大学客座教授, IEEE 会士, ACM 杰出科学家, CCF 高级会员。 代表作: 《统计学习方法》 ![Image]0 码力 | 78 页 | 3.69 MB | 2 年前3
机器学习课程-温州大学-15深度学习-GAN## 深度学习-生成式深度学习 黄海广 副教授 2023年06月 ## 本章目录 01 生成式深度学习简介 02 GAN的理论与实现模型 03 GAN的应用 04 GAN的思考与前景 ### 1. 生成式深度学习简介 01 生成式深度学习简介 02 GAN的理论与实现模型 03 GAN的应用 04 GAN的思考与前景 ### 1. 生成式深度学习简介 ## • 深度学习中常见生成式模型 深度学习中常见生成式模型 • 自编码 (AE) • 其隐变量z是一个单值映射: $ z=f(x) $ • 变分自编码 (VAE) • 其隐变量z是一个正态分布的采样 • 生成式对抗网络(GAN) • 条件生成式对抗网络(CGAN) 在生成器和判别器中添加某一标签信息 • 深度卷积生成式对抗网络 (DCGAN) • 判别器和生成器都使用了卷积神经网络(CNN)来替代GAN中的多层感知机 知机 - 为了使整个网络可微,拿掉了CNN中的池化层 • 将全连接层以全局池化层替代以减轻计算量。 ### 1. 生成式深度学习简介 ## 自编码(AE)结构图 $$ \min\|x-\hat{x}\|^{2} $$  损失函数:0 码力 | 35 页 | 1.55 MB | 2 年前3
机器学习课程-温州大学-13深度学习-Transformer## 深度学习-Transformer 黄海广 副教授 2023年05月 ## 本章目录 01 Transformer介绍 02 Transformer的工作流程 03 Transformer的训练 04 BERT ### 1 \.Transformer介绍 01 Transformer介绍 02 Transformer的工作流程 03 Transformer的训练 Transformer的工作流程 从编码器输入的句子首先会经过一个自注意力(self-attention)层,这层帮助编码器在对每个单词编码时关注输入句子的其他单词。 自注意力层的输出会传递到前馈(feed-forward)神经网络中。每个位置的单词对应的前馈神经网络都完全一样(译注:另一种解读就是一层窗口为一个单词的一维卷积神经网络)。解码器中也有编码器的自注意力(self-attention)层和前馈(fe Transformer的工作流程 ## 将输入序列进行词嵌入之后,每个单词都会流经编码器中的两个子层。 Transformer的一个核心特性,在这里输入序列中每个位置的单词都有自己独特的路径流入编码器。在自注意力层中,这些路径之间存在依赖关系。而前馈(feed-forward)层没有这些依赖关系。因此在前馈(feed-forward)层时可以并行执行各种路径。 












