awesome-multi-modal
The paper list in the multimodal domain.
https://github.com/zipzou/awesome-multi-modal
Last synced: 17 days ago
JSON representation
-
Image Generation
-
Augoregressive or MLM Paradigm in Discrete Space
- https://arxiv.org/abs/2406.06525
- https://github.com/FoundationVision/LlamaGen
- https://arxiv.org/abs/2206.10789
- https://arxiv.org/abs/2105.13290
- https://github.com/THUDM/CogView
- https://arxiv.org/abs/2204.14217
- https://arxiv.org/abs/2202.04200
- https://github.com/google-research/maskgit
- https://arxiv.org/abs/2404.02905
- https://github.com/FoundationVision/VAR
- https://arxiv.org/abs/2406.11838
-
Diffusion Paradigm
-
GAN Paradigm
-
-
Textual Large Language Model Backbone
- https://arxiv.org/abs/2210.02414
- https://arxiv.org/abs/2103.10360
- https://github.com/THUDM/GLM
- https://arxiv.org/abs/2210.11416
- https://github.com/google-research/FLAN
- https://arxiv.org/abs/2302.13971
- https://github.com/meta-llama/llama/tree/llama_v1
- https://arxiv.org/abs/2307.09288
- https://github.com/meta-llama/llama
- https://lmsys.org/blog/2023-03-30-vicuna/
- https://github.com/lm-sys/FastChat
- https://crfm.stanford.edu/2023/03/13/alpaca.html
- https://github.com/tatsu-lab/stanford_alpaca
- https://arxiv.org/abs/2306.11644
- https://arxiv.org/abs/2309.16609
- https://github.com/QwenLM/Qwen
- https://arxiv.org/abs/2012.00413
- https://github.com/TsinghuaAI/CPM-1-Generate
- https://arxiv.org/abs/2106.10715
- https://github.com/TsinghuaAI/CPM
- https://arxiv.org/abs/2404.06395
- https://github.com/OpenBMB/MiniCPM
- https://arxiv.org/abs/2403.04652
- https://github.com/01-ai/Yi
- this https URL
- https://github.com/THUDM/GLM-130B/
- this https URL
-
Vision LLM for Generation
- https://arxiv.org/abs/2201.12086
- https://github.com/salesforce/BLIP
- https://arxiv.org/abs/2301.12597
- https://github.com/salesforce/LAVIS
- https://arxiv.org/abs/2304.10592
- this https URL
- https://github.com/Vision-CAIR/MiniGPT-4;
- https://arxiv.org/abs/2304.08485
- https://github.com/haotian-liu/LLaVA
- https://arxiv.org/abs/2305.06500
- this https URL
- https://arxiv.org/abs/2304.14178
- https://github.com/X-PLUG/mPLUG-Owl
- https://arxiv.org/abs/2311.04257
- https://arxiv.org/abs/2307.02469
- https://github.com/bytedance/lynx-llm
- https://github.com/Yuliang-Liu/Monkey
- https://arxiv.org/abs/2308.12966
- https://github.com/QwenLM/Qwen-VL
- https://arxiv.org/abs/2403.11703
- https://github.com/thunlp/LLaVA-UHD
- https://llava-vl.github.io/blog/2024-01-30-llava-next/
- https://arxiv.org/abs/2401.02330
- https://github.com/zhuyiche/llava-phi
- https://arxiv.org/abs/2312.14238
- https://github.com/OpenGVLab/InternVL
- https://arxiv.org/abs/2403.09611
- https://arxiv.org/abs/2204.14198
- https://arxiv.org/abs/2308.01390
- https://github.com/mlfoundations/open_flamingo
- https://arxiv.org/abs/2311.03079
- https://github.com/THUDM/CogVLM
- https://arxiv.org/abs/2403.06199
- https://arxiv.org/abs/2310.01218
- https://github.com/AILab-CVC/SEED-X
- https://arxiv.org/abs/2404.14396
- https://github.com/zhuyiche/llava-phi
-
Vision Model Backbone
- https://arxiv.org/abs/2010.11929
- https://github.com/google-research/vision_transformer
- https://arxiv.org/abs/2103.14030
- https://github.com/microsoft/Swin-Transformer
- https://arxiv.org/abs/2103.00020
- https://github.com/OpenAI/CLIP
- https://arxiv.org/abs/2303.15343
- https://github.com/google-research/big_vision
- https://arxiv.org/abs/2211.07636
- https://github.com/baaivision/EVA
- https://arxiv.org/abs/2303.15389
- https://github.com/baaivision/EVA/tree/master/EVA-CLIP
- https://arxiv.org/abs/2303.11331
- https://github.com/baaivision/EVA/tree/master/EVA-02
- https://arxiv.org/abs/2104.14294
- https://github.com/facebookresearch/dino
- https://arxiv.org/abs/2304.07193
- https://arxiv.org/abs/2303.05499
- https://github.com/IDEA-Research/GroundingDINO
- https://arxiv.org/abs/2304.02643
- this https URL
- https://github.com/facebookresearch/segment-anything
- https://arxiv.org/abs/2103.15691
- this https URL
- https://arxiv.org/abs/2307.06304
- https://arxiv.org/abs/2111.06377
- https://github.com/facebookresearch/mae
- https://arxiv.org/abs/2212.00794
Programming Languages
Categories
Sub Categories
Keywords
large-language-models
5
deep-learning
4
llama
3
pytorch
3
vision-language-model
3
vision-language-transformer
3
llm
3
pretrained-models
3
gpt
3
language-model
3
object-detection
2
multi-modal
2
image-text-retrieval
2
vision-language
2
vision-transformer
2
auto-regressive-model
2
diffusion-models
2
image-classification
2
multimodal
2
semantic-segmentation
2
image-generation
2
transformers
2
instruction-tuning
2
image-captioning
2
foundation-models
2
chatgpt
2
chatbot
2
mask-rcnn
1
imagenet
1
instruction-following
1
deep-learning-library
1
ade20k
1
multimodal-datasets
1
multimodal-deep-learning
1
salesforce
1
open-world-detection
1
open-world
1
vision-and-language
1
vision-framework
1
natural-language-processing
1
vision-language-pretraining
1
visual-question-anwsering
1
flash-attention
1
chinese
1
visual-language-learning
1
gpt-4
1
multi-modality
1
llama-2
1
llava
1
flamingo
1