arXiv AI· Adrian Bulat, Yassine Ouali, Georgios Tzimiropoulos·· 10 小时前评分53
One Block, Multiple Depths: Recurrent Vision Transformers with Depth-Programmed Experts
摘要
在本工作中,我们证明单个Transformer块,通过重复应用,可以在不使用中间特征蒸馏的情况下,与完整的深度视觉编码器在相似推理FLOPs下达到相同的准确率。reViT通过将每个重复深度的FFN表示为小共享专家银行的凸组合来恢复深度特定的变换。连续归一化深度坐标程序这种混合,定义了FFN参数空间中的可重采样轨迹。我们在此设计中评估了两种情况:监督的ImageNet-1k训练和从DINOv2教师进行的知识蒸馏。
推荐理由
请对照arXiv AI原文,核对完整说明及适用条件。
本站只提供摘要与原文入口。完整内容请阅读原文。
来源:arXiv AI · arxiv.org