{"id":21028788,"url":"https://github.com/tuvovan/vision_transformer_keras","last_synced_at":"2025-07-21T07:04:20.225Z","repository":{"id":166767841,"uuid":"303287860","full_name":"tuvovan/Vision_Transformer_Keras","owner":"tuvovan","description":"Keras Implementation of Vision Transformer (An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale)","archived":false,"fork":false,"pushed_at":"2020-11-13T07:48:02.000Z","size":681,"stargazers_count":97,"open_issues_count":1,"forks_count":26,"subscribers_count":2,"default_branch":"master","last_synced_at":"2025-05-15T11:33:34.258Z","etag":null,"topics":["computer-vision","image-recognition","keras","tensorflow","transformer","vision"],"latest_commit_sha":null,"homepage":"https://openreview.net/pdf?id=YicbFdNTTy","language":"Python","has_issues":true,"has_wiki":null,"has_pages":null,"mirror_url":null,"source_name":null,"license":null,"status":null,"scm":"git","pull_requests_enabled":true,"icon_url":"https://github.com/tuvovan.png","metadata":{"files":{"readme":"README.md","changelog":null,"contributing":null,"funding":null,"license":null,"code_of_conduct":null,"threat_model":null,"audit":null,"citation":null,"codeowners":null,"security":null,"support":null,"governance":null,"roadmap":null,"authors":null,"dei":null,"publiccode":null,"codemeta":null}},"created_at":"2020-10-12T05:35:44.000Z","updated_at":"2025-04-16T11:12:23.000Z","dependencies_parsed_at":null,"dependency_job_id":"f7f93c9b-87c4-44f7-86b2-a93985c7bae8","html_url":"https://github.com/tuvovan/Vision_Transformer_Keras","commit_stats":null,"previous_names":["tuvovan/vision_transformer_keras"],"tags_count":0,"template":false,"template_full_name":null,"purl":"pkg:github/tuvovan/Vision_Transformer_Keras","repository_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/tuvovan%2FVision_Transformer_Keras","tags_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/tuvovan%2FVision_Transformer_Keras/tags","releases_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/tuvovan%2FVision_Transformer_Keras/releases","manifests_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/tuvovan%2FVision_Transformer_Keras/manifests","owner_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/owners/tuvovan","download_url":"https://codeload.github.com/tuvovan/Vision_Transformer_Keras/tar.gz/refs/heads/master","sbom_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/tuvovan%2FVision_Transformer_Keras/sbom","host":{"name":"GitHub","url":"https://github.com","kind":"github","repositories_count":266255244,"owners_count":23900098,"icon_url":"https://github.com/github.png","version":null,"created_at":"2022-05-30T11:31:42.601Z","updated_at":"2022-07-04T15:15:14.044Z","host_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub","repositories_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories","repository_names_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repository_names","owners_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/owners"}},"keywords":["computer-vision","image-recognition","keras","tensorflow","transformer","vision"],"created_at":"2024-11-19T11:59:06.266Z","updated_at":"2025-07-21T07:04:20.194Z","avatar_url":"https://github.com/tuvovan.png","language":"Python","funding_links":[],"categories":[],"sub_categories":[],"readme":"# Vision Transformer\nVision Transformer\n![teaser](vit.png)\n## Content\n- [Vision Transformer](#vision-transformer)\n- [Getting Started](#getting-started)\n- [Running](#running)\n- [References](#references)\n- [Citations](#citation)\n\n## Getting Started\n\n- Clone the repository\n\n### Prerequisites\n\n- Tensorflow 2.2.0+\n- Tensorflow_addons\n- Python 3.6+\n- Keras 2.3.0\n- PIL\n- numpy\n\n```python\npip install -r requirements.txt\n```\n\n## Running\n### Training \n    ```\n    python train.py\n    ```\n## Usage\n### Training\n```\nusage: train.py [-h] [--logdir LOGDIR] [--image-size IMAGE_SIZE]\n                [--patch-size PATCH_SIZE] [--num-layers NUM_LAYERS]\n                [--d-model D_MODEL] [--num-heads NUM_HEADS]\n                [--mlp-dim MLP_DIM] [--lr LR] [--weight-decay WEIGHT_DECAY]\n                [--batch-size BATCH_SIZE] [--epochs EPOCHS]\n```\n\n```\noptional arguments: -h, --help                show this help message and exit\n                    --log_dir                 folder to save weights\n                    --image_size              size of input image\n                    --patch_size              size of patch to encode\n                    --num-layers              number of transformer\n                    --d-model                 embedding dimension\n                    --mlp-dim                 hidden layer dimension\n                    --lr                      learning rate\n                    --weight-decay            weight decay\n                    --batch-size              batch size\n                    --epochs                  epochs\n```\n\n## License\n\nThis project is licensed under the MIT License - see the [LICENSE](https://github.com/tuvovan/ANL-HDRI/blob/master/LICENSE) file for details\n\n## References\n[1] AN IMAGE IS WORTH 16X16 WORDS: TRANSFORMERS FOR IMAGE RECOGNITION AT SCALE - [link](https://openreview.net/pdf?id=YicbFdNTTy)\n\n[2] Text classification with Transformer - [link](https://keras.io/examples/nlp/text_classification_with_transformer/)\n\n## Acknowledgments\n- This work is heavily based on [Keras](https://keras.io/examples/nlp/text_classification_with_transformer/) version of Transformer.\n- Any ideas on updating or misunderstanding, please send me an email: \u003cvovantu.hust@gmail.com\u003e\n- If you find this repo helpful, kindly give me a star.\n\n","project_url":"https://awesome.ecosyste.ms/api/v1/projects/github.com%2Ftuvovan%2Fvision_transformer_keras","html_url":"https://awesome.ecosyste.ms/projects/github.com%2Ftuvovan%2Fvision_transformer_keras","lists_url":"https://awesome.ecosyste.ms/api/v1/projects/github.com%2Ftuvovan%2Fvision_transformer_keras/lists"}