深度学习周报(6.15—6.21)
一、本周学习内容
本周主要学习了Transformer网络的基本原理,重点了解了自注意力机制(Self-Attention)、多头注意力(Multi-Head Attention)、位置编码(Positional Encoding)、残差连接(Residual Connection)以及前馈神经网络(Feed Forward Network)等核心模块,同时进一步学习了特征融合与模型泛化相关理论,对Transformer在计算机视觉领域中的应用有了更加深入的认识。
二、本周知识点总结
(一)Self-Attention(自注意力机制)
自注意力机制能够建立输入序列 内部各元素之间的关系,使模型能够关注全局信息。
首先构建三个矩阵:
随后计算注意力权重:
其中:
-
(Q):Query(查询)
-
(K):Key(键)
-
(V):Value(值)
-
(d_k):Key向量维度
Self-Attention能够突破卷积局部感受野限制,捕获长距离依赖关系。
(二)Multi-Head Attention(多头注意力)
多头注意力通过多个注意力头并行学习不同特征。
计算公式:
其中每一个Head都学习不同的信息表示,提高模型表达能力。
相比单头注意力,多头注意力能够学习更加丰富的上下文特征。
(三)Position Encoding(位置编码)
由于Transformer本身不具有位置信息,需要加入位置编码。
经典正弦位置编码:
位置编码使模型能够学习序列中各元素的位置关系。
(四)Residual Connection(残差连接)
残差连接能够缓解深层网络训练困难的问题。
计算形式:
其中:
-
(F(X)):网络学习的残差映射;
-
(X):输入特征。
残差连接有助于信息传递,提高模型训练稳定性。
(五)Feed Forward Network(前馈神经网络)
Transformer中每个编码器都包含一个前馈网络。
计算公式:
FFN能够进一步提取特征,提高模型非线性表达能力。
(六)Layer Normalization(层归一化)
Layer Normalization用于稳定模型训练过程。
计算公式:
相比Batch Normalization,更适合Transformer等序列模型。
(七)Vision Transformer(ViT)
Vision Transformer将图像划分为多个Patch,每个Patch作为一个Token输入Transformer。
若输入图像大小为
Patch大小为
则Patch数量为
ViT利用Transformer建模全局特征,在图像分类、目标检测和图像分割等任务中具有良好的性能。
三、本周收获
本周系统学习了Transformer网络的整体结构,重点掌握了Self-Attention、多头注意力、位置编码、残差连接、前馈神经网络及Vision Transformer等基础知识,对Transformer如何建模全局特征以及其在计算机视觉中的优势有了更加深入的理解,为后续学习Swin Transformer、SegFormer等视觉Transformer模型奠定了理论基础。
四、下周学习计划
-
学习Swin Transformer的窗口注意力(Window Attention)机制;
-
深入理解SegFormer网络结构及其编码器设计;
-
学习多尺度特征融合(Multi-scale Feature Fusion)方法;
-
阅读Transformer在医学图像分析中的相关文献,总结其在图像分割任务中的应用特点;
-
进一步掌握Transformer模型的训练策略与性能优化方法。
更多推荐



所有评论(0)