{"id":13444423,"url":"https://github.com/lijiaman/awesome-transformer-for-vision","last_synced_at":"2025-03-20T18:32:39.188Z","repository":{"id":176008089,"uuid":"326113978","full_name":"lijiaman/awesome-transformer-for-vision","owner":"lijiaman","description":null,"archived":false,"fork":false,"pushed_at":"2021-03-22T06:02:30.000Z","size":5,"stargazers_count":280,"open_issues_count":1,"forks_count":22,"subscribers_count":15,"default_branch":"main","last_synced_at":"2024-05-19T18:58:43.111Z","etag":null,"topics":[],"latest_commit_sha":null,"homepage":null,"language":null,"has_issues":true,"has_wiki":null,"has_pages":null,"mirror_url":null,"source_name":null,"license":null,"status":null,"scm":"git","pull_requests_enabled":true,"icon_url":"https://github.com/lijiaman.png","metadata":{"files":{"readme":"README.md","changelog":null,"contributing":"contributing.md","funding":null,"license":null,"code_of_conduct":null,"threat_model":null,"audit":null,"citation":null,"codeowners":null,"security":null,"support":null,"governance":null,"roadmap":null,"authors":null}},"created_at":"2021-01-02T05:15:33.000Z","updated_at":"2024-01-04T16:53:36.000Z","dependencies_parsed_at":null,"dependency_job_id":"32b44044-a6eb-4998-a8d4-e2f6f514264d","html_url":"https://github.com/lijiaman/awesome-transformer-for-vision","commit_stats":null,"previous_names":["lijiaman/awesome-transformer-for-vision"],"tags_count":0,"template":false,"template_full_name":null,"repository_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/lijiaman%2Fawesome-transformer-for-vision","tags_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/lijiaman%2Fawesome-transformer-for-vision/tags","releases_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/lijiaman%2Fawesome-transformer-for-vision/releases","manifests_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/lijiaman%2Fawesome-transformer-for-vision/manifests","owner_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/owners/lijiaman","download_url":"https://codeload.github.com/lijiaman/awesome-transformer-for-vision/tar.gz/refs/heads/main","host":{"name":"GitHub","url":"https://github.com","kind":"github","repositories_count":221792892,"owners_count":16881289,"icon_url":"https://github.com/github.png","version":null,"created_at":"2022-05-30T11:31:42.601Z","updated_at":"2022-07-04T15:15:14.044Z","host_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub","repositories_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories","repository_names_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repository_names","owners_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/owners"}},"keywords":[],"created_at":"2024-07-31T04:00:22.504Z","updated_at":"2024-10-28T06:30:54.243Z","avatar_url":"https://github.com/lijiaman.png","language":null,"funding_links":[],"categories":["Uncategorized","References","Others"],"sub_categories":["Uncategorized","Attention for Others","Other Video Tasks"],"readme":"\n# Awesome Transformer for Vision Resources List [![Awesome](https://cdn.rawgit.com/sindresorhus/awesome/d7305f38d29fed78fa85652e3a63e154dd8e8829/media/badge.svg)](https://github.com/sindresorhus/awesome)\n\n\u003e A curated list of papers \u0026 resources linked to Transformer-based research mainly for vision and graphics tasks.\n\n## Contents\n\n- [Papers](#papers)\n\t- [Original Paper](#papers-ori)\n\t- [2D Vision Tasks](#papers-2d)\n\t\t- [Classification](#papers-classification)\n\t\t- [Detection](#papers-detection)\n\t\t- [Segmentation](#papers-segmentation)\n\t\t- [Tracking](#papers-tracking)\n\t\t- [Image Synthesis](#papers-image-synthesis)\n\t\t- [Action Understanding](#papers-action)\n\t- [3D Vision Tasks](#papers-3d)\n\t\t- [Point Cloud Processing](#papers-point-cloud)\n\t\t- [Motion Modeling](#papers-motion)\n\t\t- [Human Body Modeling](#papers-body)\n\t- [Others](#papers-others)\n\t\t- [Music Modeling](#papers-music)\n\n- [Contributing](#contributing)\n\n\n\u003ca name=\"papers\"\u003e\u003c/a\u003e\n# Papers\n\n\u003ca name=\"papers-ori\"\u003e\u003c/a\u003e\n## Original Paper\n\n[Attention Is All You Need](https://papers.nips.cc/paper/2017/file/3f5ee243547dee91fbd053c1c4a845aa-Paper.pdf). Ashish Vaswani*, Noam Shazeer*, Niki Parmar*, Jakob Uszkoreit*, Llion Jones*, Aidan N. Gomez*, Łukasz Kaiser*, Illia Polosukhin*. NIPs 2017.\n\n\u003ca name=\"papers-2d\"\u003e\u003c/a\u003e\n## 2D Vision Tasks\n\n\u003ca name=\"papers-classification\"\u003e\u003c/a\u003e\n### Classification\n\n[AN IMAGE IS WORTH 16X16 WORDS: TRANSFORMERS FOR IMAGE RECOGNITION AT SCALE](https://arxiv.org/pdf/2010.11929.pdf). Alexey Dosovitskiy∗, Lucas Beyer∗, Alexander Kolesnikov∗, Dirk Weissenborn∗, Xiaohua Zhai∗, Thomas Unterthiner, Mostafa Dehghani, Matthias Minderer, Georg Heigold, Sylvain Gelly, Jakob Uszkoreit, Neil Houlsby. Arxiv 2020. \n\n\u003ca name=\"papers-detection\"\u003e\u003c/a\u003e\n### Detection\n\n[Fast Convergence of DETR with Spatially Modulated Co-Attention](https://arxiv.org/pdf/2101.07448.pdf). Peng Gao, Minghang Zheng, Xiaogang Wang, Jifeng Dai, Hongsheng Li. Arxiv 2021.\n\n[End-to-End Object Detection with Adaptive Clustering Transformer](https://arxiv.org/pdf/2011.09315.pdf). Minghang Zheng, Peng Gao, Xiaogang Wang, Hongsheng Li, Hao Dong. Arxiv 2020.\n\n[Toward Transformer-Based Object Detection](https://arxiv.org/pdf/2012.09958.pdf). Josh Beal*, Eric Kim*, Eric Tzeng, Dong Huk Park, Andrew Zhai, Dmitry Kislyuk. Arxiv 2020.\n\n[Rethinking Transformer-based Set Prediction for Object Detection](https://arxiv.org/pdf/2011.10881.pdf). Zhiqing Sun*, Shengcao Cao*, Yiming Yang, Kris Kitani. Arxiv 2020.\n\n[UP-DETR: Unsupervised Pre-training for Object Detection with Transformers](https://arxiv.org/pdf/2011.09094.pdf). Zhigang Dai1, Bolun Cai, Yugeng Lin, Junying Chen. Arxiv 2020.\n\n[DEFORMABLE DETR: DEFORMABLE TRANSFORMERS FOR END-TO-END OBJECT DETECTION](https://arxiv.org/pdf/2010.04159.pdf). Xizhou Zhu∗, Weijie Su∗, Lewei Lu, Bin Li, Xiaogang Wang, Jifeng Dai. Arxiv 2020. \n\n[End-to-End Object Detection with Transformers](https://arxiv.org/pdf/2005.12872.pdf). Nicolas Carion*, Francisco Massa*, Gabriel Synnaeve, Nicolas Usunier, Alexander Kirillov, and Sergey Zagoruyko. ECCV 2020.\n\n\u003ca name=\"papers-segmentation\"\u003e\u003c/a\u003e\n### Segmentation\n\n[Rethinking Semantic Segmentation from a Sequence-to-Sequence Perspective with Transformers](https://arxiv.org/pdf/2012.15840.pdf). Sixiao Zheng, Jiachen Lu, Hengshuang Zhao, Xiatian Zhu, Zekun Luo, Yabiao Wang, Yanwei Fu, Jianfeng Feng, Tao Xiang, Philip H.S. Torr, Li Zhang. Arxiv 2020.\n\n[End-to-End Video Instance Segmentation with Transformers](https://arxiv.org/pdf/2011.14503.pdf). Yuqing Wang, Zhaoliang Xu, Xinlong Wang, Chunhua Shen, Baoshan Cheng, Hao Shen, Huaxia Xia. Arxiv 2020.\n\n\u003ca name=\"papers-tracking\"\u003e\u003c/a\u003e\n### Tracking \n\n[TransTrack: Multiple-Object Tracking with Transformer](https://arxiv.org/pdf/2012.15460.pdf). Peize Sun, Yi Jiang, Rufeng Zhang, Enze Xie, Jinkun Cao, Xinting Hu, Tao Kong, Zehuan Yuan, Changhu Wang, Ping Luo. Arxiv 2020.\n\n\u003ca name=\"papers-image-synthesis\"\u003e\u003c/a\u003e\n### Image Synthesis\n\n[Taming Transformers for High-Resolution Image Synthesis](https://arxiv.org/pdf/2012.09841.pdf). Patrick Esser*, Robin Rombach*, Bjorn Ommer. Arxiv 2020.\n\n\u003ca name=\"papers-action\"\u003e\u003c/a\u003e\n### Action Understanding\n\n[Video Action Transformer Network](https://arxiv.org/pdf/1812.02707.pdf). Rohit Girdhar, Joao Carreira, Carl Doersch, Andrew Zisserman. CVPR 2019.\n\n\n\u003ca name=\"papers-3d\"\u003e\u003c/a\u003e\n## 3D Vision Tasks\n\n\u003ca name=\"papers-point-cloud\"\u003e\u003c/a\u003e\n### Point Cloud Processing\n\n[PCT: Point Cloud Transformer](https://arxiv.org/pdf/2012.09688.pdf). Meng-Hao Guo, Jun-Xiong Cai, Zheng-Ning Liu, Tai-Jiang Mu, Ralph R. Martin, Shi-Min Hu. Arxiv 2020.\n\n[Point Transformer](https://arxiv.org/pdf/2012.09164.pdf). Hengshuang Zhao, Li Jiang, Jiaya Jia, Philip Torr, Vladlen Koltun. Arxiv 2020.\n\n\u003ca name=\"papers-motion\"\u003e\u003c/a\u003e\n### Motion Modeling\n\n[Learning to Generate Diverse Dance Motions with Transformer](https://arxiv.org/pdf/2008.08171.pdf). Jiaman Li, Yihang Yin, Hang Chu, Yi Zhou, Tingwu Wang, Sanja Fidler, Hao Li. Arxiv 2020.\n\n[A Spatio-temporal Transformer for 3D Human Motion Prediction](https://arxiv.org/pdf/2004.08692.pdf). Emre Aksan*, Peng Cao*, Manuel Kaufmann, Otmar Hilliges. Arxiv 2020.\n\n\u003ca name=\"papers-body\"\u003e\u003c/a\u003e\n### Human Body Modeling\n\n[End-to-End Human Pose and Mesh Reconstruction with Transformers](https://arxiv.org/pdf/2012.09760.pdf). Kevin Lin, Lijuan Wang, Zicheng Liu. Arxiv 2020.\n\n\u003ca name=\"papers-others\"\u003e\u003c/a\u003e\n## Others\n\n\u003ca name=\"papers-music\"\u003e\u003c/a\u003e\n### Music Modeling\n\n[MUSIC TRANSFORMER: GENERATING MUSIC WITH LONG-TERM STRUCTURE](https://arxiv.org/pdf/1809.04281.pdf). Cheng-Zhi Anna Huang, Ashish Vaswani, Jakob Uszkoreit, Noam Shazeer, Ian Simon, Curtis Hawthorne, Andrew M. Dai, Matthew D. Hoffman, Monica Dinculescu, Douglas Eck. Arxiv 2018. \n\n# Contributing\nPlease see [CONTRIBUTING](https://github.com/openMVG/awesome_3DReconstruction_list/blob/master/contributing.md) for details.\n","project_url":"https://awesome.ecosyste.ms/api/v1/projects/github.com%2Flijiaman%2Fawesome-transformer-for-vision","html_url":"https://awesome.ecosyste.ms/projects/github.com%2Flijiaman%2Fawesome-transformer-for-vision","lists_url":"https://awesome.ecosyste.ms/api/v1/projects/github.com%2Flijiaman%2Fawesome-transformer-for-vision/lists"}