计算机视觉 — 论文笔记

视频理解与多模态视觉语言模型

2021

NeurIPS

NeurIPS-2021 VLMo:基于模态专家混合的统一视觉-语言预训练

2021-12-01 · vision-language, contrastive-learning, transformer

NeurIPS

NeurIPS-2021 视觉 Transformer 的有趣特性

2021-11-25 · vision-language, transformer

NeurIPS

NeurIPS-2021 先对齐后融合:基于动量蒸馏的视觉-语言表示学习(ALBEF)

2021-11-10 · vision-language

CVPR

CVPR-2021 掩码自编码器是可扩展的视觉学习者(MAE)

2021-11-06 · vision-language, Transformer

arXiv

arXiv-2021 ActionCLIP:视频动作识别新范式

2021-09-17 · video, action-recognition, contrastive-learning

ICCV

ICCV-2021 Swin Transformer:基于移位窗口的层次化视觉 Transformer

2021-08-17 · vision-language, transformer

arXiv

arXiv-2021 CLIP 能为视觉-语言任务带来多大收益

2021-07-06 · vision-language, contrastive-learning

ICML

ICML-2021 Perceiver:基于迭代注意力的通用感知

2021-06-23 · vision-language

arXiv

arXiv-2021 CLIP4Clip:CLIP 端到端视频片段检索的实证研究

2021-05-08 · Video, Contrastive Learning

ICCV

ICCV-2021 自监督视觉 Transformer 训练的实证研究

2021-04-05 · vision-language

ICML

ICML-2021 从自然语言监督中学习可迁移视觉模型(CLIP)

2021-02-26 · vision-language, contrastive-learning

ICML

ICML-2021 ViLT:无卷积无区域监督的视觉-语言 Transformer

2021-02-05 · vision-language, contrastive-learning, transformer

GCPR

GCPR-2021 AudioCLIP:将 CLIP 扩展至图像、文本与音频

2021-01-24 · vision-language, transformer, contrastive-learning

ICLR

ICLR-2021 一张图抵 16x16 个词:大规模图像识别的 Transformer(ViT)

2021-01-13 · vision-language, transformer

ICML

ICML-2021 时空注意力是视频理解所需的一切吗

2021-01-09 · video, vision-language, transformer

← 浏览全部笔记