计算机视觉 — 论文笔记
视频理解与多模态视觉语言模型
2014
2015
2016
2017
2018
DeepMind-2018 基于对比预测编码的表示学习(CPC)
2018-07-10 · vision-language, contrastive-learning
CVPR-2018 基于非参数实例级判别的无监督特征学习
2018-05-01 · unsupervised-learning, contrastive-learning
CVPR-2018 非局部神经网络
2018-04-13 · convolutional-neural-network
CVPR-2018 深入审视动作识别中的时空卷积
2018-04-12 · video, action-recognition
2019
2020
ECCV-2020 CMC:对比多视图编码
2020-12-18 · contrastive-learning
NeurIPS-2020 大型自监督模型是强大的半监督学习者
2020-12-06 · semi-supervised learning
NeurIPS-2020 自举潜在表示:自监督学习新方法(BYOL)
2020-12-06 · self-supervised learning
NeurIPS-2020 通过对比簇分配的无监督视觉特征学习(SwAV)
2020-12-01 · unsupervised-learning, contrastive-learning
arXiv-2020 BYOL 无需批统计依然有效
2020-10-20 · vision-language, transformer, contrastive-learning
ICML-2020 视觉表示对比学习的简单框架(SimCLR)
2020-07-01 · contrastive-learning
ECCV-2020 基于 Transformer 的端到端目标检测(DETR)
2020-05-28 · transformer, object-detection
ICLR-2020 DivideMix:将噪声标签学习视为半监督学习
2020-04-26 · noisy label, semi-supervised, GMM, MixMatch
CVPR-2020 用于无监督视觉表示学习的动量对比(MoCo)
2020-03-23 · vision-language, contrastive-learning
2021
NeurIPS-2021 VLMo:基于模态专家混合的统一视觉-语言预训练
2021-12-01 · vision-language, contrastive-learning, transformer
NeurIPS-2021 视觉 Transformer 的有趣特性
2021-11-25 · vision-language, transformer
NeurIPS-2021 先对齐后融合:基于动量蒸馏的视觉-语言表示学习(ALBEF)
2021-11-10 · vision-language
CVPR-2021 掩码自编码器是可扩展的视觉学习者(MAE)
2021-11-06 · vision-language, Transformer
arXiv-2021 ActionCLIP:视频动作识别新范式
2021-09-17 · video, action-recognition, contrastive-learning
ICCV-2021 Swin Transformer:基于移位窗口的层次化视觉 Transformer
2021-08-17 · vision-language, transformer
arXiv-2021 CLIP 能为视觉-语言任务带来多大收益
2021-07-06 · vision-language, contrastive-learning
ICML-2021 Perceiver:基于迭代注意力的通用感知
2021-06-23 · vision-language
arXiv-2021 CLIP4Clip:CLIP 端到端视频片段检索的实证研究
2021-05-08 · Video, Contrastive Learning
ICCV-2021 自监督视觉 Transformer 训练的实证研究
2021-04-05 · vision-language
ICML-2021 从自然语言监督中学习可迁移视觉模型(CLIP)
2021-02-26 · vision-language, contrastive-learning
ICML-2021 ViLT:无卷积无区域监督的视觉-语言 Transformer
2021-02-05 · vision-language, contrastive-learning, transformer
GCPR-2021 AudioCLIP:将 CLIP 扩展至图像、文本与音频
2021-01-24 · vision-language, transformer, contrastive-learning
ICLR-2021 一张图抵 16x16 个词:大规模图像识别的 Transformer(ViT)
2021-01-13 · vision-language, transformer
ICML-2021 时空注意力是视频理解所需的一切吗
2021-01-09 · video, vision-language, transformer
2022
MM-2022 语言能理解深度吗
2022-10-10 · vision-language, contrastive-learning
NeurIPS-2022 CoCa:对比字幕器即图像-文本基础模型
2022-08-27 · vision-language, contrastive-learning
SIGGRAPH-2022 CLIPasso:语义感知的目标素描
2022-07-22 · contrastive-learning
CVPR-2022 GroupViT:文本监督下涌现的语义分割
2022-07-18 · video, vision-language
ECCV-2022 CDS:对比深度监督
2022-07-12 · contrastive-learning
CVPR-2022 PointCLIP:用 CLIP 理解点云
2022-06-23 · vision-language, contrastive-learning
arXiv-2022 GLIPv2:统一定位与视觉-语言理解
2022-06-05 · vision-language, contrastive-learning, object-detection
OpenAI-2022 基于 CLIP 潜在表示的层次化文本条件图像生成(DALL·E 2)
2022-04-13 · vision-language, contrastive-learning
ICLR-2022 基于视觉-语言知识蒸馏的开放词汇目标检测
2022-01-29 · vision-language, contrastive-learning, object-detection
ICLR-2022 Perceiver IO:结构化输入输出的通用架构
2022-01-29 · vision-language
ICML-2022 BLIP:自举语言-图像预训练实现统一视觉-语言理解与生成
2022-01-24 · vision-language, transformer, contrastive-learning
CVPR-2022 定位式语言-图像预训练(GLIP)
2022-01-17 · LLM, NLP, vision-language
ICLR-2022 语言驱动的语义分割
2022-01-10 · LLM, NLP, vision-language