计算机视觉 — 论文笔记

视频理解与多模态视觉语言模型

2021

NeurIPS-2021 VLMo:基于模态专家混合的统一视觉-语言预训练

NeurIPS-2021 视觉 Transformer 的有趣特性

NeurIPS-2021 先对齐后融合:基于动量蒸馏的视觉-语言表示学习(ALBEF)

CVPR-2021 掩码自编码器是可扩展的视觉学习者(MAE)

arXiv-2021 ActionCLIP:视频动作识别新范式

ICCV-2021 Swin Transformer:基于移位窗口的层次化视觉 Transformer

arXiv-2021 CLIP 能为视觉-语言任务带来多大收益

ICML-2021 Perceiver:基于迭代注意力的通用感知

arXiv-2021 CLIP4Clip:CLIP 端到端视频片段检索的实证研究

ICCV-2021 自监督视觉 Transformer 训练的实证研究

ICML-2021 从自然语言监督中学习可迁移视觉模型(CLIP)

ICML-2021 ViLT:无卷积无区域监督的视觉-语言 Transformer

GCPR-2021 AudioCLIP:将 CLIP 扩展至图像、文本与音频

ICLR-2021 一张图抵 16x16 个词:大规模图像识别的 Transformer(ViT)

ICML-2021 时空注意力是视频理解所需的一切吗

2022

MM-2022 语言能理解深度吗

NeurIPS-2022 CoCa:对比字幕器即图像-文本基础模型

SIGGRAPH-2022 CLIPasso:语义感知的目标素描

CVPR-2022 GroupViT:文本监督下涌现的语义分割

ECCV-2022 CDS:对比深度监督

CVPR-2022 PointCLIP:用 CLIP 理解点云

arXiv-2022 GLIPv2:统一定位与视觉-语言理解

OpenAI-2022 基于 CLIP 潜在表示的层次化文本条件图像生成(DALL·E 2)

ICLR-2022 基于视觉-语言知识蒸馏的开放词汇目标检测

ICLR-2022 Perceiver IO:结构化输入输出的通用架构

ICML-2022 BLIP:自举语言-图像预训练实现统一视觉-语言理解与生成

CVPR-2022 定位式语言-图像预训练(GLIP)

ICLR-2022 语言驱动的语义分割

← 浏览全部笔记