论文主要研究 VIT 的优化方法,用于解决其参数量大、计算开销高的不足。这个论文提出 Edge-RecViT 模型,包含 token-adaptive block 和 recursive transformer block。

模型整体框架如下图所示,输入图像划分为 patch,转化为 token,然后输入Edge-Aware Ranker。

(1)Edge-Aware Ranker: 结构为MLP,输出为1~12的值,即每个 token 在 Transformer block 迭代次数。本模块精准识别边缘、纹理、轮廓等语义丰富的 token,进行多轮特征提取,分配更多迭代次数。简单背景token提前终止计算,削减冗余计算。

(2)Recursive Transformer Block: 采用头 - 共享中间层 - 尾三段式极简设计,仅 3 组独立参数。 头部层θh\theta_hθh):所有令牌统一经过,完成初始特征变换。递归中间层θr\theta_rθr):全局参数共享,根据 EARR 分配的深度,令牌迭代对应次数;高信息边缘令牌迭代次数更多,逐步精细化特征。尾部层θt\theta_tθt):仅执行满深度(12 层)的令牌进入,聚合高层特征用于分类。

相较于现有 token-adaptive 方法,本文模型精度更高、参数量与计算量更低。

Logo

脑启社区是一个专注类脑智能领域的开发者社区。欢迎加入社区,共建类脑智能生态。社区为开发者提供了丰富的开源类脑工具软件、类脑算法模型及数据集、类脑知识库、类脑技术培训课程以及类脑应用案例等资源。

更多推荐