计算机视觉 — 论文笔记
视频理解与多模态视觉语言模型
2018
2020
2021
NeurIPS-2021 VLMo:基于模态专家混合的统一视觉-语言预训练
NeurIPS-2021 视觉 Transformer 的有趣特性
NeurIPS-2021 先对齐后融合:基于动量蒸馏的视觉-语言表示学习(ALBEF)
CVPR-2021 掩码自编码器是可扩展的视觉学习者(MAE)
arXiv-2021 ActionCLIP:视频动作识别新范式
ICCV-2021 Swin Transformer:基于移位窗口的层次化视觉 Transformer
arXiv-2021 CLIP 能为视觉-语言任务带来多大收益
ICML-2021 Perceiver:基于迭代注意力的通用感知
arXiv-2021 CLIP4Clip:CLIP 端到端视频片段检索的实证研究
ICCV-2021 自监督视觉 Transformer 训练的实证研究
ICML-2021 从自然语言监督中学习可迁移视觉模型(CLIP)
ICML-2021 ViLT:无卷积无区域监督的视觉-语言 Transformer
GCPR-2021 AudioCLIP:将 CLIP 扩展至图像、文本与音频
ICLR-2021 一张图抵 16x16 个词:大规模图像识别的 Transformer(ViT)
ICML-2021 时空注意力是视频理解所需的一切吗
2022
MM-2022 语言能理解深度吗
NeurIPS-2022 CoCa:对比字幕器即图像-文本基础模型
SIGGRAPH-2022 CLIPasso:语义感知的目标素描
CVPR-2022 GroupViT:文本监督下涌现的语义分割
ECCV-2022 CDS:对比深度监督
CVPR-2022 PointCLIP:用 CLIP 理解点云
arXiv-2022 GLIPv2:统一定位与视觉-语言理解
OpenAI-2022 基于 CLIP 潜在表示的层次化文本条件图像生成(DALL·E 2)
ICLR-2022 基于视觉-语言知识蒸馏的开放词汇目标检测
ICLR-2022 Perceiver IO:结构化输入输出的通用架构
ICML-2022 BLIP:自举语言-图像预训练实现统一视觉-语言理解与生成
CVPR-2022 定位式语言-图像预训练(GLIP)