(cvpr26) Edge-RecViT: Efficient Vision Transformer via Semantic-Refined Dynamic Recursion
·
论文主要研究 VIT 的优化方法,用于解决其参数量大、计算开销高的不足。这个论文提出 Edge-RecViT 模型,包含 token-adaptive block 和 recursive transformer block。
模型整体框架如下图所示,输入图像划分为 patch,转化为 token,然后输入Edge-Aware Ranker。

(1)Edge-Aware Ranker: 结构为MLP,输出为1~12的值,即每个 token 在 Transformer block 迭代次数。本模块精准识别边缘、纹理、轮廓等语义丰富的 token,进行多轮特征提取,分配更多迭代次数。简单背景token提前终止计算,削减冗余计算。
(2)Recursive Transformer Block: 采用头 - 共享中间层 - 尾三段式极简设计,仅 3 组独立参数。 头部层(θh\theta_hθh):所有令牌统一经过,完成初始特征变换。递归中间层(θr\theta_rθr):全局参数共享,根据 EARR 分配的深度,令牌迭代对应次数;高信息边缘令牌迭代次数更多,逐步精细化特征。尾部层(θt\theta_tθt):仅执行满深度(12 层)的令牌进入,聚合高层特征用于分类。
相较于现有 token-adaptive 方法,本文模型精度更高、参数量与计算量更低。
更多推荐



所有评论(0)