← 返回上级 NeurIPS-2021 视觉 Transformer 的有趣特性 2021-11-25 · NeurIPS· 计算机视觉 · vision-language, transformer 论文地址:Intriguing Properties of Vision Transformers ViT的性质,泛读即可 因为用了tranformer结构,ViT更加关注整体信息,而传统的卷积需要很多层才能感受到全局信息。 健壮性更好:在遮挡、分布偏移、对抗性、排序错乱、语义分割等情况表现更优异 <HR align=left color=#987cb9 SIZE=1> 相关笔记 arXiv-2021 ActionCLIP:视频动作识别新范式 2021-09-17 CVPR-2021 掩码自编码器是可扩展的视觉学习者(MAE) 2021-11-06 NeurIPS-2021 先对齐后融合:基于动量蒸馏的视觉-语言表示学习(ALBEF) 2021-11-10 NeurIPS-2021 VLMo:基于模态专家混合的统一视觉-语言预训练 2021-12-01 ICLR-2022 语言驱动的语义分割 2022-01-10 CVPR-2022 定位式语言-图像预训练(GLIP) 2022-01-17 更多计算机视觉笔记 →