{"id":54806,"url":"https://github.com/showlab/Awesome-Video-Diffusion","name":"Awesome-Video-Diffusion","description":"A curated list of recent diffusion models for video generation, editing, and various other applications.","projects_count":2693,"last_synced_at":"2026-08-21T10:00:47.428Z","repository":{"id":153612825,"uuid":"628959446","full_name":"showlab/Awesome-Video-Diffusion","owner":"showlab","description":"A curated list of recent diffusion models for video generation, editing, and various other applications.","archived":false,"fork":false,"pushed_at":"2026-06-16T07:51:42.000Z","size":632,"stargazers_count":5716,"open_issues_count":1,"forks_count":366,"subscribers_count":165,"default_branch":"main","last_synced_at":"2026-07-13T20:03:26.140Z","etag":null,"topics":["awesome","diffusion-models","motion-customization","video-editing","video-generation","video-generation-evaluation"],"latest_commit_sha":null,"homepage":"","language":null,"has_issues":true,"has_wiki":null,"has_pages":null,"mirror_url":null,"source_name":null,"license":null,"status":null,"scm":"git","pull_requests_enabled":true,"icon_url":"https://github.com/showlab.png","metadata":{"files":{"readme":"README.md","changelog":null,"contributing":null,"funding":null,"license":null,"code_of_conduct":null,"threat_model":null,"audit":null,"citation":null,"codeowners":null,"security":null,"support":null,"governance":null,"roadmap":null,"authors":null,"dei":null,"publiccode":null,"codemeta":null,"zenodo":null,"notice":null,"maintainers":null,"copyright":null,"agents":null,"dco":null,"cla":null}},"created_at":"2023-04-17T10:34:17.000Z","updated_at":"2026-07-13T16:46:15.000Z","dependencies_parsed_at":"2023-10-25T02:27:11.728Z","dependency_job_id":"1c340268-962c-4d15-b68d-7f6de9f80200","html_url":"https://github.com/showlab/Awesome-Video-Diffusion","commit_stats":null,"previous_names":[],"tags_count":0,"template":false,"template_full_name":null,"purl":"pkg:github/showlab/Awesome-Video-Diffusion","repository_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/showlab%2FAwesome-Video-Diffusion","tags_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/showlab%2FAwesome-Video-Diffusion/tags","releases_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/showlab%2FAwesome-Video-Diffusion/releases","manifests_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/showlab%2FAwesome-Video-Diffusion/manifests","owner_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/owners/showlab","download_url":"https://codeload.github.com/showlab/Awesome-Video-Diffusion/tar.gz/refs/heads/main","sbom_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/showlab%2FAwesome-Video-Diffusion/sbom","scorecard":null,"host":{"name":"GitHub","url":"https://github.com","kind":"github","repositories_count":286080680,"owners_count":36172933,"icon_url":"https://github.com/github.png","version":null,"created_at":"2022-05-30T11:31:42.601Z","updated_at":"2026-07-20T02:08:10.276Z","status":"online","status_checked_at":"2026-08-01T02:00:05.789Z","response_time":100,"last_error":null,"robots_txt_status":"success","robots_txt_updated_at":"2025-07-24T06:49:26.215Z","robots_txt_url":"https://github.com/robots.txt","online":true,"can_crawl_api":true,"host_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub","repositories_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories","repository_names_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repository_names","owners_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/owners"}},"created_at":"2024-01-19T09:12:34.583Z","updated_at":"2026-08-21T10:00:47.429Z","primary_language":null,"list_of_lists":false,"displayable":true,"categories":["Table of Contents \u003c!-- omit in toc --\u003e"],"sub_categories":["Commercial Product","Video Generation","3D","Controllable Video Generation","Long Video / Film Generation","Video Enhancement and Restoration","Human or Subject Motion","Video Editing","Talking Head Generation","Video Understanding","Healthcare and Biology","Motion Customization","Code-rendered Video Generation","Open-source Toolboxes and Foundation Models","Evaluation Benchmarks and Metrics","New Video Generation Benchmark and Metrics","Audio Synthesis for Video","Long-form Video Generation and Completion","3D / NeRF","Open-World Model","Video Generation with 3D/Physical Prior","Rendering with Virtual Engine","World Model","AI Safety","Policy Learning","Policy Learning with Video Generation","Video Generation with Physical Prior/3D","Video Generation with Physical Prior / 3D","Reinforcement Learning for Video Generation","Human Feedback for Video Generation","Character Customization","Efficient Video Generation","Virtual Try-On","Efficiency for Video Generation","4D","Human/AI Feedback for Video Generation","Game Generation","Unified Model for Generation and Understanding","Try On with Video Generation","Other Applications","Other Application for Video Gen","Acceleration for Video Generation"],"readme":"# Awesome Video Diffusion [![Awesome](https://cdn.rawgit.com/sindresorhus/awesome/d7305f38d29fed78fa85652e3a63e154dd8e8829/media/badge.svg)](https://github.com/sindresorhus/awesome) \u003c!-- omit in toc --\u003e\nA curated list of recent diffusion models for video generation, editing, restoration, understanding, nerf, etc.\n\n\u003cp align=\"center\"\u003e\n\u003cimg src=\"https://makeavideo.studio/assets/overview.webp\" width=\"240px\"/\u003e\n\u003cimg src=\"https://makeavideo.studio/assets/A_teddy_bear_painting_a_portrait.webp\" width=\"240px\"/\u003e    \n\u003c/p\u003e\n\n\u003cp align=\"center\"\u003e\n\u003cimg src=\"https://tuneavideo.github.io/assets/teaser.gif\" width=\"480px\"/\u003e  \n\u003c/p\u003e\n\n\u003cp align=\"center\"\u003e\n\u003cimg src=\"https://github.com/ChenyangQiQi/FateZero/blob/main/docs/gif_results/17_car_posche_01_concat_result.gif?raw=true\" width=\"240px\"/\u003e\n\u003cimg src=\"https://github.com/ChenyangQiQi/FateZero/blob/main/docs/gif_results/3_sunflower_vangogh_conat_result.gif?raw=true\" width=\"240px\"/\u003e    \n\u003c/p\u003e\n\n\u003cp align=\"center\"\u003e\n(Source: \u003ca href=\"https://makeavideo.studio/\"\u003eMake-A-Video\u003c/a\u003e, \u003ca href=\"https://tuneavideo.github.io/\"\u003eTune-A-Video\u003c/a\u003e, and \u003ca href=\"https://fate-zero-edit.github.io/\"\u003eFate/Zero\u003c/a\u003e.)\n\u003c/p\u003e\n\n\n## Table of Contents \u003c!-- omit in toc --\u003e\n- [Open-source Toolboxes and Foundation Models](#open-source-toolboxes-and-foundation-models)\n- [Evaluation Benchmarks and Metrics](#evaluation-benchmarks-and-metrics)\n- [Commercial Product](#commercial-product)\n- [Video Generation](#video-generation)\n- [Efficient Video Generation](#efficient-video-generation)\n- [Controllable Video Generation](#controllable-video-generation)\n- [Character Customization](#character-customization)\n- [Motion Customization](#motion-customization)\n- [Long Video / Film Generation](#long-video--film-generation)\n- [Video Generation with 3D/Physical Prior](#video-generation-with-3dphysical-prior)\n- [Video Editing](#video-editing)\n- [Human or Subject Motion](#human-or-subject-motion)\n- [Video Enhancement and Restoration](#video-enhancement-and-restoration)\n- [Audio Synthesis for Video](#audio-synthesis-for-video)\n- [Talking Head Generation](#talking-head-generation)\n- [Reinforcement Learning for Video Generation](#reinforcement-learning-for-video-generation)\n- [Policy Learning](#policy-learning)\n- [Virtual Try-On](#virtual-try-on)\n- [3D](#3d)\n- [4D](#4d)\n- [Game Generation](#game-generation)\n- [AI Safety](#ai-safety)\n- [Rendering with Virtual Engine](#rendering-with-virtual-engine)\n- [Open-World Model](#open-world-model)\n- [Video Understanding](#video-understanding)\n- [Healthcare and Biology](#healthcare-and-biology)\n- [Other Applications](#other-applications)\n- [Code-rendered Video Generation](#code-rendered-video-generation)\n\n### Open-source Toolboxes and Foundation Models \n\n+ [Omni-Rewriter](https://github.com/WayneJin0918/Omni-Rewriter)  \n  [![Star](https://img.shields.io/github/stars/WayneJin0918/Omni-Rewriter.svg?style=social\u0026label=Star)](https://github.com/WayneJin0918/Omni-Rewriter)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://waynejin0918.github.io/Omni-Rewriter/)  \n  Open agentic prompt-expansion harness for image/video generation (schema → validate → bounded repair → dialect render; H3/Seedance/Seedream/Qwen-Image). Expand ≠ generate.\n\n+ [NanoI2V](https://github.com/Shubham2376G/NanoI2V)  \n  [![Star](https://img.shields.io/github/stars/Shubham2376G/NanoI2V.svg?style=social\u0026label=Star)](https://github.com/Shubham2376G/NanoI2V)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://shubham2376g.github.io/NanoI2V/)  \n  A step-by-step teaching series for building an Image-to-Video model from scratch in PyTorch, covering 3D VAEs, DiT, Flow Matching, RoPE, and conditioning.\n\n+ [Helios: Real Real-Time Long Video Generation Model](https://arxiv.org/abs/2603.04379)  \n  [![Star](https://img.shields.io/github/stars/PKU-YuanGroup/Helios.svg?style=social\u0026label=Star)](https://github.com/PKU-YuanGroup/Helios)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2603.04379)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://pku-yuangroup.github.io/Helios-Page/)\n\n+ [Waver: Wave Your Way to Lifelike Video Generation](https://github.com/FoundationVision/Waver)\n  [![Star](https://img.shields.io/github/stars/FoundationVision/Waver.svg?style=social\u0026label=Star)](https://github.com/FoundationVision/Waver)\n\n+ [FastVideo: A unified inference and post-training framework for accelerated video generation](https://github.com/hao-ai-lab/FastVideo)\n  [![Star](https://img.shields.io/github/stars/hao-ai-lab/FastVideo.svg?style=social\u0026label=Star)](https://github.com/hao-ai-lab/FastVideo)\n\n+ [LightX2V: Light Video Generation Inference Framework](https://github.com/ModelTC/lightx2v)  \n  [![Star](https://img.shields.io/github/stars/ModelTC/lightx2v.svg?style=social\u0026label=Star)](https://github.com/ModelTC/lightx2v)\n  \n+ [Wan-Video](https://github.com/Wan-Video/Wan2.1)  \n  [![Star](https://img.shields.io/github/stars/Wan-Video/Wan2.1.svg?style=social\u0026label=Star)](https://github.com/Wan-Video/Wan2.1)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://wanxai.com/)\n\n+ [SkyReels-V2](https://github.com/SkyworkAI/SkyReels-V2)  \n  [![Star](https://img.shields.io/github/stars/SkyworkAI/SkyReels-V2.svg?style=social\u0026label=Star)](https://github.com/SkyworkAI/SkyReels-V2)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://www.skyreels.ai/)\n  \n+ [DiffSynth-Studio](https://github.com/modelscope/DiffSynth-Studio)  \n  [![Star](https://img.shields.io/github/stars/modelscope/DiffSynth-Studio.svg?style=social\u0026label=Star)](https://github.com/modelscope/DiffSynth-Studio)\n\n+ [Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model](https://arxiv.org/abs/2502.10248)  \n  [![Star](https://img.shields.io/github/stars/stepfun-ai/Step-Video-T2V.svg?style=social\u0026label=Star)](https://github.com/stepfun-ai/Step-Video-T2V)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2502.10248)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://yuewen.cn/videos)\n\n+ [Cosmos](https://github.com/NVIDIA/Cosmos)  \n  [![Star](https://img.shields.io/github/stars/NVIDIA/Cosmos.svg?style=social\u0026label=Star)](https://github.com/NVIDIA/Cosmos)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2501.03575)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://research.nvidia.com/labs/dir/cosmos1/)\n\n+ [LTX-Video](https://github.com/Lightricks/LTX-Video)  \n  [![Star](https://img.shields.io/github/stars/Lightricks/LTX-Video.svg?style=social\u0026label=Star)](https://github.com/Lightricks/LTX-Video)\n\n+ [HunyuanVideo: A Systematic Framework For Large Video Generative Models](https://arxiv.org/abs/2412.03603)  \n  [![Star](https://img.shields.io/github/stars/Tencent/HunyuanVideo.svg?style=social\u0026label=Star)](https://github.com/Tencent/HunyuanVideo)\n\n+ [VideoTuna](https://videoverses.github.io/videotuna/)  \n  [![Star](https://img.shields.io/github/stars/VideoVerses/VideoTuna.svg?style=social\u0026label=Star)](https://github.com/VideoVerses/VideoTuna)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://videoverses.github.io/videotuna/)\n\n+ [Allegro](https://rhymes.ai/blog-details/allegro-advanced-video-generation-model)  \n  [![Star](https://img.shields.io/github/stars/rhymes-ai/Allegro.svg?style=social\u0026label=Star)](https://github.com/rhymes-ai/Allegro)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2410.15458)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://rhymes.ai/blog-details/allegro-advanced-video-generation-model)\n\n+ [Mochi 1](https://www.genmo.ai/blog)  \n  [![Star](https://img.shields.io/github/stars/genmoai/mochi.svg?style=social\u0026label=Star)](https://github.com/genmoai/mochi)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://www.genmo.ai/blog)\n\n+ [Movie Gen: A Cast of Media Foundation Models](https://ai.meta.com/research/publications/movie-gen-a-cast-of-media-foundation-models/)  \n  [![Star](https://img.shields.io/github/stars/facebookresearch/MovieGenBench.svg?style=social\u0026label=Star)](https://github.com/facebookresearch/MovieGenBench)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/pdf/2410.13720)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://www.youtube.com/playlist?list=PL86eLlsPNfyi27GSizYjinpYxp7gEl5K8)\n\n+ [Pyramidal Flow Matching for Efficient Video Generative Modeling](https://pyramid-flow.github.io/)  \n  [![Star](https://img.shields.io/github/stars/jy0205/Pyramid-Flow.svg?style=social\u0026label=Star)](https://github.com/jy0205/Pyramid-Flow)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://pyramid-flow.github.io/)\n\n+ [Open-Sora-Plan](https://github.com/PKU-YuanGroup/Open-Sora-Plan)  \n  [![Star](https://img.shields.io/github/stars/PKU-YuanGroup/Open-Sora-Plan.svg?style=social\u0026label=Star)](https://github.com/PKU-YuanGroup/Open-Sora-Plan)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://github.com/PKU-YuanGroup/Open-Sora-Plan/blob/main/docs/Report-v1.0.0.md)\n\n+ [Open-Sora](https://github.com/hpcaitech/Open-Sora)  \n  [![Star](https://img.shields.io/github/stars/hpcaitech/Open-Sora.svg?style=social\u0026label=Star)](https://github.com/hpcaitech/Open-Sora)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://github.com/hpcaitech/Open-Sora/blob/main/docs/zh_CN/README.md)\n\n+ [Stable Video Diffusion](https://github.com/Stability-AI/generative-models)  \n  [![Star](https://img.shields.io/github/stars/Stability-AI/generative-models.svg?style=social\u0026label=Star)](https://github.com/Stability-AI/generative-models)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://stability.ai/news/stable-video-diffusion-open-ai-video-model) \n\n+ [Show-1](https://github.com/showlab/Show-1)  \n  [![Star](https://img.shields.io/github/stars/showlab/Show-1.svg?style=social\u0026label=Star)](https://github.com/showlab/Show-1)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://showlab.github.io/Show-1/) \n\n+ [Hotshot-XL (text-to-GIF)](https://github.com/hotshotco/Hotshot-XL)  \n  [![Star](https://img.shields.io/github/stars/hotshotco/Hotshot-XL.svg?style=social\u0026label=Star)](https://github.com/hotshotco/Hotshot-XL)\n\n+ [zeroscope_v2](https://huggingface.co/cerspense/zeroscope_v2_576w)  \n  [![Website](https://img.shields.io/badge/576w-9cf)](https://huggingface.co/cerspense/zeroscope_v2_576w) \n  [![Website](https://img.shields.io/badge/XL-9cf)](https://huggingface.co/cerspense/zeroscope_v2_XL) \n\n+ [I2VGen-XL (image-to-video / video-to-video)](https://modelscope.cn/models/damo/Image-to-Video/summary)  \n  [![Website](https://img.shields.io/badge/Website(I2V)-9cf)](https://modelscope.cn/models/damo/Image-to-Video/summary) \n  [![Website](https://img.shields.io/badge/Website(V2V)-9cf)](https://modelscope.cn/models/damo/Video-to-Video/summary) \n\n+ [text-to-video-synthesis-colab](https://github.com/camenduru/text-to-video-synthesis-colab)  \n  [![Star](https://img.shields.io/github/stars/camenduru/text-to-video-synthesis-colab.svg?style=social\u0026label=Star)](https://github.com/camenduru/text-to-video-synthesis-colab)\n\n+ [VideoCrafter: A Toolkit for Text-to-Video Generation and Editing](https://github.com/VideoCrafter/VideoCrafter)  \n  [![Star](https://img.shields.io/github/stars/VideoCrafter/VideoCrafter.svg?style=social\u0026label=Star)](https://github.com/VideoCrafter/VideoCrafter)\n\n+ [ModelScope (Text-to-video synthesis)](https://modelscope.cn/models/damo/text-to-video-synthesis/summary)  \n  [![Star](https://img.shields.io/github/stars/modelscope/modelscope.svg?style=social\u0026label=Star)](https://github.com/modelscope/modelscope)\n\n+ [Diffusers (Text-to-video synthesis)](https://huggingface.co/docs/diffusers/main/en/api/pipelines/text_to_video#texttovideo-synthesis)  \n  [![Star](https://img.shields.io/github/stars/huggingface/diffusers.svg?style=social\u0026label=Star)](https://github.com/huggingface/diffusers)\n\n+ [Wunjo CE (Video Generation and Editing)](https://github.com/wladradchenko/wunjo.wladradchenko.ru)  \n  [![Star](https://img.shields.io/github/stars/wladradchenko/wunjo.wladradchenko.ru.svg?style=social\u0026label=Star)](https://github.com/wladradchenko/wunjo.wladradchenko.ru)\n  \n### Evaluation Benchmarks and Metrics\n\n+ [LikePhys: Evaluating Intuitive Physics Understanding in Video Diffusion Models via Likelihood Preference](https://arxiv.org/abs/2510.11512) (Oct., 2025)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2510.11512)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://yuanjianhao508.github.io/LikePhys/)\n\n+ [Stable Cinemetrics: Structured Taxonomy and Evaluation for Professional Video Generation](https://arxiv.org/abs/2509.26555) (Sep., 2025)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2509.26555)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://stable-cinemetrics.github.io/)\n\n\n+ [OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation](https://arxiv.org/abs/2505.20292) (Mar., 2025)  \n  [![Star](https://img.shields.io/github/stars/PKU-YuanGroup/OpenS2V-Nexus.svg?style=social\u0026label=Star)](https://github.com/PKU-YuanGroup/OpenS2V-Nexus)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2505.20292)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://pku-yuangroup.github.io/OpenS2V-Nexus/)\n\n+ [VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness](https://arxiv.org/abs/2503.21755) (Mar., 2025)  \n  [![Star](https://img.shields.io/github/stars/Vchitect/VBench.svg?style=social\u0026label=Star)](https://github.com/Vchitect/VBench)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2503.21755)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://vchitect.github.io/VBench-2.0-project/)\n\n+ [Impossible Videos](https://arxiv.org/abs/2503.14378) (Mar., 2025)  \n  [![Star](https://img.shields.io/github/stars/showlab/Impossible-Videos.svg?style=social\u0026label=Star)](https://github.com/showlab/Impossible-Videos)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2503.14378)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://showlab.github.io/Impossible-Videos/)\n  \n+ [MEt3R: Measuring Multi-View Consistency in Generated Images](https://geometric-rl.mpi-inf.mpg.de/met3r/static/assets/met3r.pdf) (Jan., 2025)  \n  [![Star](https://img.shields.io/github/stars/mohammadasim98/MEt3R.svg?style=social\u0026label=Star)](https://github.com/mohammadasim98/MEt3R)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://geometric-rl.mpi-inf.mpg.de/met3r/static/assets/met3r.pdf)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://geometric-rl.mpi-inf.mpg.de/met3r/)\n\n+ [Is Your World Simulator a Good Story Presenter? A Consecutive Events-Based Benchmark for Future Long Video Generation](https://arxiv.org/abs/2412.16211) (Dec., 2024)  \n  [![Star](https://img.shields.io/github/stars/ypwang61/StoryEval.svg?style=social\u0026label=Star)](https://github.com/ypwang61/StoryEval/tree/main)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2412.16211)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://ypwang61.github.io/project/StoryEval/)\n\n+ [Evaluation Agent, Efficient and Promptable Evaluation Framework for Visual Generative Models](https://arxiv.org/abs/2412.09645) (Dec., 2024)  \n  [![Star](https://img.shields.io/github/stars/Vchitect/Evaluation-Agent.svg?style=social\u0026label=Star)](https://github.com/Vchitect/Evaluation-Agent)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2412.09645)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://vchitect.github.io/Evaluation-Agent-project/)\n\n+ [Frechet Video Motion Distance: A Metric for Evaluating Motion Consistency in Videos](https://arxiv.org/pdf/2407.16124) (Jun., 2024)  \n  [![Star](https://img.shields.io/github/stars/DSL-Lab/FVMD-frechet-video-motion-distance.svg?style=social\u0026label=Star)](https://github.com/DSL-Lab/FVMD-frechet-video-motion-distance)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/pdf/2407.16124)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://pypi.org/project/fvmd/1.0.0/)\n  \n+ [T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation](https://arxiv.org/abs/2407.14505) (Jun., 2024)  \n  [![Star](https://img.shields.io/github/stars/KaiyueSun98/T2V-CompBench.svg?style=social\u0026label=Star)](https://github.com/KaiyueSun98/T2V-CompBench)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2407.14505)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://t2v-compbench.github.io/)\n  \n+ [ChronoMagic-Bench: A Benchmark for Metamorphic Evaluation of Text-to-Time-lapse Video Generation](https://arxiv.org/abs/2406.18522) (NeurIPS, 2024)  \n  [![Star](https://img.shields.io/github/stars/PKU-YuanGroup/ChronoMagic-Bench.svg?style=social\u0026label=Star)](https://github.com/PKU-YuanGroup/ChronoMagic-Bench)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2406.18522)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://pku-yuangroup.github.io/ChronoMagic-Bench/)\n\n+ [PEEKABOO: Interactive Video Generation via Masked-Diffusion](https://arxiv.org/abs/2312.07509) (CVPR, 2024)  \n  [![Star](https://img.shields.io/github/stars/microsoft/Peekaboo.svg?style=social\u0026label=Star)](https://github.com/microsoft/Peekaboo)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2312.07509)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://jinga-lala.github.io/projects/Peekaboo/)\n\n+ [T2VScore: Towards A Better Metric for Text-to-Video Generation](https://arxiv.org/abs/2401.07781) (Jan., 2024)      \n  [![Star](https://img.shields.io/github/stars/showlab/T2VScore.svg?style=social\u0026label=Star)](https://github.com/showlab/T2VScore)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2401.07781)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://showlab.github.io/T2VScore/)\n\n+ [StoryBench: A Multifaceted Benchmark for Continuous Story Visualization](https://arxiv.org/abs/2308.11606) (NeurIPS, 2023)      \n  [![Star](https://img.shields.io/github/stars/google/storybench.svg?style=social\u0026label=Star)](https://github.com/google/storybench)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2308.11606)\n\n+ [VBench: Comprehensive Benchmark Suite for Video Generative Models](https://arxiv.org/abs/2311.17982) (Nov., 2023)      \n  [![Star](https://img.shields.io/github/stars/Vchitect/VBench.svg?style=social\u0026label=Star)](https://github.com/Vchitect/VBench?tab=readme-ov-file)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2311.17982)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://vchitect.github.io/VBench-project/) \n\n+ [FETV: A Benchmark for Fine-Grained Evaluation of Open-Domain Text-to-Video Generation](https://arxiv.org/abs/2311.01813) (Nov., 2023)      \n  [![Star](https://img.shields.io/github/stars/llyx97/FETV.svg?style=social\u0026label=Star)](https://github.com/llyx97/FETV)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2311.01813)\n\n+ [EvalCrafter: Benchmarking and Evaluating Large Video Generation Models](https://arxiv.org/abs/2310.11440) (Oct., 2023)      \n  [![Star](https://img.shields.io/github/stars/EvalCrafter/EvalCrafter.svg?style=social\u0026label=Star)](https://github.com/EvalCrafter/EvalCrafter)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2310.11440)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://evalcrafter.github.io/) \n  [![Dataset](https://img.shields.io/badge/Dataset-e97451)](https://huggingface.co/datasets/RaphaelLiu/EvalCrafter_T2V_Dataset) \n\n+ [Evaluation of Text-to-Video Generation Models: A Dynamics Perspective](https://arxiv.org/pdf/2407.01094) (Jul., 2024)      \n  [![Star](https://img.shields.io/github/stars/MingXiangL/DEVIL.svg?style=social\u0026label=Star)](https://github.com/MingXiangL/DEVIL)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/pdf/2407.01094)\n\n+ [VidProM: A Million-scale Real Prompt-Gallery Dataset for Text-to-Video Diffusion Models](https://arxiv.org/abs/2403.06098) (May., 2024)      \n  [![Star](https://img.shields.io/github/stars/WangWenhao0716/VidProM.svg?style=social\u0026label=Star)](https://github.com/WangWenhao0716/VidProM)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2403.06098)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://github.com/WangWenhao0716/VidProM) \n  [![Dataset](https://img.shields.io/badge/Dataset-e97451)](https://vidprom.github.io/) \n  \n+ [Panda-70M: Captioning 70M Videos with Multiple Cross-Modality Teachers](https://arxiv.org/abs/2402.19479) (CVPR, 2024)      \n  [![Star](https://img.shields.io/github/stars/snap-research/Panda-70M.svg?style=social\u0026label=Star)](https://github.com/snap-research/Panda-70M)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2402.19479)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://github.com/snap-research/Panda-70M) \n  [![Dataset](https://img.shields.io/badge/Dataset-e97451)](https://snap-research.github.io/Panda-70M/) \n\n+ [ReLight My NeRF: A Dataset for Novel View Synthesis and Relighting of Real World Objects](https://openaccess.thecvf.com/content/CVPR2023/html/Toschi_ReLight_My_NeRF_A_Dataset_for_Novel_View_Synthesis_and_CVPR_2023_paper.html) (CVPR, 2023)      \n  [![Star](https://img.shields.io/github/stars/eyecan-ai/rene.svg?style=social\u0026label=Star)](https://github.com/eyecan-ai/rene)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://openaccess.thecvf.com/content/CVPR2023/html/Toschi_ReLight_My_NeRF_A_Dataset_for_Novel_View_Synthesis_and_CVPR_2023_paper.html)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://eyecan-ai.github.io/rene/) \n\n### Commercial Product\n\n+ [Veo 2](https://sora.com/) ([Google](https://deepmind.google/technologies/veo/veo-2/))  \n  [![Website](https://img.shields.io/badge/Website-9cf)](https://deepmind.google/technologies/veo/veo-2/)\n\n+ [Kling](https://klingai.com/?gad_source=1\u0026gclid=CjwKCAiAudG5BhAREiwAWMlSjMtrwX5RsW6xQvRSSg05fn1bA8wo9-AJiAKTIr-IkZnewbLXpCM44RoCkrsQAvD_BwE) ([KuaiShou](https://www.kuaishou.com/en))  \n  [![Website](https://img.shields.io/badge/Website-9cf)](https://klingai.com/?gad_source=1\u0026gclid=CjwKCAiAudG5BhAREiwAWMlSjMtrwX5RsW6xQvRSSg05fn1bA8wo9-AJiAKTIr-IkZnewbLXpCM44RoCkrsQAvD_BwE)\n\n+ [Gen 3](https://app.runwayml.com/login) ([Runway](https://runwayml.com/))  \n  [![Website](https://img.shields.io/badge/Website-9cf)](https://app.runwayml.com/login)\n\n+ [Dream Machine](https://lumalabs.ai/dream-machine) ([Luma AI](https://lumalabs.ai/dream-machine))  \n  [![Website](https://img.shields.io/badge/Website-9cf)](https://lumalabs.ai/dream-machine)\n\n+ [Sora](https://sora.com/) ([Open AI](https://openai.com/))  \n  [![Website](https://img.shields.io/badge/Website-9cf)](https://sora.com/)\n\n+ [Wunjo](https://wunjo.online/) ([WR](https://wladradchenko.ru/en#products))  \n  [![Website](https://img.shields.io/badge/Website-9cf)](https://wunjo.online/)\n\n+ [Shortodella](https://shortodella.com/)  \n  [![Website](https://img.shields.io/badge/Website-9cf)](https://shortodella.com/)\n\n+ [Seedream AI Studio](https://seedream4.video/)  \n  [![Website](https://img.shields.io/badge/Website-9cf)](https://seedream4.video/)\n\n+ [Riffkit](https://riffkit.ai/)  \n  [![Website](https://img.shields.io/badge/Website-9cf)](https://riffkit.ai/)\n  [![GitHub](https://img.shields.io/badge/GitHub-riffkit%2Fskill-181717?logo=github)](https://github.com/riffkit/skill)\n\n+ [SEELE TV](https://seele.tv/)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://seele.tv/)\n\n### Video Generation\n+ [Helios: Real Real-Time Long Video Generation Model](https://arxiv.org/abs/2603.04379) (Mar., 2026)  \n  [![Star](https://img.shields.io/github/stars/PKU-YuanGroup/Helios.svg?style=social\u0026label=Star)](https://github.com/PKU-YuanGroup/Helios)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2603.04379)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://pku-yuangroup.github.io/Helios-Page/)\n\n+ [MOVA: Towards Scalable and Synchronized Video-Audio Generation](https://arxiv.org/abs/2602.08794) (Feb., 2026)\n  [![Star](https://img.shields.io/github/stars/OpenMOSS/MOVA.svg?style=social\u0026label=Star)](https://github.com/OpenMOSS/MOVA)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2602.08794)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://mosi.cn/models/mova)\n\n+ [Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation](https://arxiv.org/abs/2602.02214) (Feb., 2026)  \n  [![Star](https://img.shields.io/github/stars/thu-ml/Causal-Forcing.svg?style=social\u0026label=Star)](https://github.com/thu-ml/Causal-Forcing)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2602.02214)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://thu-ml.github.io/CausalForcing.github.io/)\n\n+ [VINO: A Unified Visual Generator with Interleaved OmniModal Context](https://arxiv.org/abs/2601.02358) (Jan., 2026)  \n  [![Star](https://img.shields.io/github/stars/SOTAMak1r/VINO-code.svg?style=social\u0026label=Star)](https://github.com/SOTAMak1r/VINO-code)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2601.02358)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://sotamak1r.github.io/VINO-web/)\n  \n+ [UltraViCo: Breaking Extrapolation Limits in Video Diffusion Transformers](https://arxiv.org/abs/2511.20123) (Oct., 2025)  \n  [![Star](https://img.shields.io/github/stars/thu-ml/RIFLEx.svg?style=social\u0026label=Star)](https://github.com/thu-ml/RIFLEx)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2511.20123)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://thu-ml.github.io/UltraViCo.github.io/)\n\n+ [VISTA: A Test-Time Self-Improving Video Generation Agent](https://arxiv.org/abs/2510.15831) (Oct., 2025 | CVPR 2026)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2510.15831)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://g-vista.github.io/)\n  \n+ [UniVideo: Unified Understanding, Generation, and Editing for Videos](https://arxiv.org/abs/2510.08377) (Oct., 2025)  \n  [![Star](https://img.shields.io/github/stars/KlingAIResearch/UniVideo.svg?style=social\u0026label=Star)](https://github.com/KlingAIResearch/UniVideo)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2510.08377)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://congwei1230.github.io/UniVideo/)\n\n+ [PUSA V1.0: Surpassing Wan-I2V with $500 Training Cost by Vectorized Timestep Adaptation](https://arxiv.org/abs/2507.16116) (July., 2025)\n  [![Star](https://img.shields.io/github/stars/Yaofang-Liu/Pusa-VidGen.svg?style=social\u0026label=Star)](https://github.com/Yaofang-Liu/Pusa-VidGen)  \n  [![PDF](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2507.16116)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://yaofang-liu.github.io/Pusa_Web/)\n\n\n+ [LayerFlow : A Unified Model for Layer-aware Video Generation](https://arxiv.org/abs/2506.04228) (May., 2025)\n  [![Star](https://img.shields.io/github/stars/dvlab-research/Jenga.svg?style=social\u0026label=Star)](https://github.com/SihuiJi/LayerFlow)  \n  [![PDF](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2506.04228)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://sihuiji.github.io/LayerFlow-Page/)\n\n\n+ [InfLVG: Reinforce Inference-Time Consistent Long Video Generation with GRPO](https://arxiv.org/abs/2505.17574) (May., 2025)\n  [![Star](https://img.shields.io/github/stars/MAPLE-AIGC/InfLVG.svg?style=social\u0026label=Star)](https://github.com/MAPLE-AIGC/InfLVG)  \n  [![PDF](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2505.17574)\n  \n+ [Training-Free Efficient Video Generation via Dynamic Token Carving](https://arxiv.org/abs/2505.16864) (May., 2025)\n  [![Star](https://img.shields.io/github/stars/dvlab-research/Jenga.svg?style=social\u0026label=Star)](https://github.com/dvlab-research/Jenga)  \n  [![PDF](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2505.16864)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://julianjuaner.github.io/projects/jenga/)\n\n\n\n+ [ReVision: High-Quality, Low-Cost Video Generation with Explicit 3D Physics Modeling for Complex Motion and Interaction](https://arxiv.org/abs/2504.21855) (Apr., 2025)  \n  [![PDF](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2504.21855)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://revision-video.github.io/)\n\n\n+ [Turbo2K: Towards Ultra-Efficient and High-Quality 2K Video Synthesis](https://jingjingrenabc.github.io/turbo2k/) (Apr., 2025)  \n  [![Website](https://img.shields.io/badge/Website-9cf)](https://jingjingrenabc.github.io/turbo2k/)\n\n\n+ [MAGI-1: Autoregressive Video Generation at Scale](https://static.magi.world/static/files/MAGI_1.pdf) (Apr., 2025)  \n  [![Star](https://img.shields.io/github/stars/SandAI-org/Magi-1.svg?style=social\u0026label=Star)](https://github.com/SandAI-org/Magi-1)\n  [![PDF](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://static.magi.world/static/files/MAGI_1.pdf)\n  [![Website](https://img.shields.io/badge/Website-9cf)](SandAI-org/Magi-1)\n\n+ [SphereDiff: Tuning-free Omnidirectional Panoramic Image and Video Generation via Spherical Latent Representation](https://arxiv.org/abs/2504.14396) (Apr., 2025)  \n  [![Star](https://img.shields.io/github/stars/pmh9960/SphereDiff.svg?style=social\u0026label=Star)](https://github.com/pmh9960/SphereDiff)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2504.14396)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://pmh9960.github.io/research/SphereDiff/)\n  \n+ [Packing Input Frame Context in Next-Frame Prediction Models for Video Generation](https://lllyasviel.github.io/frame_pack_gitpage/pack.pdf) (Apr., 2025)  \n  [![Star](https://img.shields.io/github/stars/lllyasviel/FramePack.svg?style=social\u0026label=Star)](https://github.com/lllyasviel/FramePack)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2504.08685)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://lllyasviel.github.io/frame_pack_gitpage/)\n  \n+ [SkyReels-V2: Infinite-length Film Generative Model](https://arxiv.org/abs/2504.13074) (Apr., 2025)  \n  [![Star](https://img.shields.io/github/stars/SkyworkAI/SkyReels-V2.svg?style=social\u0026label=Star)](https://github.com/SkyworkAI/SkyReels-V2)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2504.13074)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://www.skyreels.ai/home?utm_campaign=github_SkyReels_V2)\n\n  \n+ [Seaweed-7B: Cost-Effective Training of Video Generation Foundation Model](https://seaweed.video/seaweed.pdf) (Apr., 2025)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2504.08685)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://seaweed.video/)\n\n+ [Aligning Text-to-Video Generation Models with Prompt Optimization](https://arxiv.org/abs/2503.20491) (Mar., 2025)  \n  [![Star](https://img.shields.io/github/stars/thu-coai/VPO.svg?style=social\u0026label=Star)](https://github.com/thu-coai/VPO/tree/main)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2503.20491)\n\n+ [Target-Aware Video Diffusion Models](https://arxiv.org/abs/2503.18950) (Mar., 2025)  \n  [![Star](https://img.shields.io/github/stars/taeksuu/tavid.svg?style=social\u0026label=Star)](https://github.com/taeksuu/tavid)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2503.18950)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://taeksuu.github.io/tavid/)\n\n\n+ [MagicComp: Training-free Dual-Phase Refinement for Compositional Video Generation](https://arxiv.org/abs/2503.14428) (Mar., 2025)  \n  [![Star](https://img.shields.io/github/stars/Hong-yu-Zhang/MagicComp.svg?style=social\u0026label=Star)](https://github.com/Hong-yu-Zhang/MagicComp)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/pdf/2503.14428)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://hong-yu-zhang.github.io/MagicComp-Page/)\n  \n+ [Video-T1: Test-Time Scaling for Video Generation](https://arxiv.org/abs/2503.18942) (Mar., 2025)  \n  [![Star](https://img.shields.io/github/stars/liuff19/Video-T1.svg?style=social\u0026label=Star)](https://github.com/liuff19/Video-T1)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/pdf/2503.18942)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://liuff19.github.io/Video-T1/)\n\n+ [Temporal Regularization Makes Your Video Generator Stronger](https://arxiv.org/abs/2503.15417) (Mar., 2025)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/pdf/2503.15417)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://haroldchen19.github.io/FluxFlow/)\n\n  \n+ [VACE: All-in-One Video Creation and Editing](https://arxiv.org/pdf/2503.07598) (Mar., 2025)  \n  [![Star](https://img.shields.io/github/stars/ali-vilab/VACE.svg?style=social\u0026label=Star)](https://github.com/ali-vilab/VACE)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/pdf/2503.07598)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://ali-vilab.github.io/VACE-Page/)\n\n\n+ [RIFLEx: A Free Lunch for Length Extrapolation in Video Diffusion Transformers](https://arxiv.org/abs/2502.15894) (Feb., 2025)  \n  [![Star](https://img.shields.io/github/stars/thu-ml/RIFLEx.svg?style=social\u0026label=Star)](https://github.com/thu-ml/RIFLEx)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2502.15894)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://riflex-video.github.io/)\n\n+ [DLFR-VAE: Dynamic Latent Frame Rate VAE for Video Generation](https://arxiv.org/abs/2502.11897) (Feb., 2025)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2502.11897)\n\n+ [Magic 1-For-1: Generating One Minute Video Clips within One Minute](https://arxiv.org/abs/2502.07701) (Feb., 2025)  \n  [![Star](https://img.shields.io/github/stars/DA-Group-PKU/Magic-1-For-1.svg?style=social\u0026label=Star)](https://github.com/DA-Group-PKU/Magic-1-For-1)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2502.07701)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://magic-141.github.io/Magic-141/)\n\n+ [Lumina-Video: Efficient and Flexible Video Generation with Multi-scale Next-DiT](https://arxiv.org/abs/2502.06782) (Feb., 2025)  \n  [![Star](https://img.shields.io/github/stars/Alpha-VLLM/Lumina-Video.svg?style=social\u0026label=Star)](https://github.com/Alpha-VLLM/Lumina-Video)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2502.06782)\n\n+ [Inference-Time Text-to-Video Alignment with Diffusion Latent Beam Search](https://arxiv.org/abs/2501.19252) (Jan., 2025)  \n  [![Star](https://img.shields.io/github/stars/shim0114/T2V-Diffusion-Search.svg?style=social\u0026label=Star)](https://github.com/shim0114/T2V-Diffusion-Search)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/pdf/2501.19252)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://sites.google.com/view/t2v-dlbs)\n\n+ [RepVideo: Rethinking Cross-Layer Representation for Video Generation](https://arxiv.org/pdf/2501.08994) (Jan., 2025)  \n  [![Star](https://img.shields.io/github/stars/Vchitect/RepVideo.svg?style=social\u0026label=Star)](https://github.com/Vchitect/RepVideo)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/pdf/2501.08994)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://vchitect.github.io/RepVid-Webpage/)\n\n+ [Large Motion Video Autoencoding with Cross-modal Video VAE](https://arxiv.org/abs/2412.17805) (Dec., 2024)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2412.17805)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://github.com/VideoVerses/VideoVAEPlus)\n\n+ [MotiF: Making Text Count in Image Animation with Motion Focal Loss](https://arxiv.org/abs/2412.16153) (Dec., 2024)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2412.16153)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://wang-sj16.github.io/motif/#BibTeX)\n\n+ [VideoDPO: Omni-Preference Alignment for Video Diffusion Generation](https://arxiv.org/pdf/2412.14167) (Dec., 2024)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/pdf/2412.14167)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://videodpo.github.io/)\n\n+ [Autoregressive Video Generation without Vector Quantization](https://arxiv.org/abs/2412.14169) (Dec., 2024)  \n  [![Star](https://img.shields.io/github/stars/baaivision/NOVA.svg?style=social\u0026label=Star)](https://github.com/baaivision/NOVA)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2412.14169)\n\n+ [AniDoc: Animation Creation Made Easier](https://arxiv.org/pdf/2412.14173) (Dec., 2024)  \n  [![Star](https://img.shields.io/github/stars/yihao-meng/AniDoc.svg?style=social\u0026label=Star)](https://github.com/yihao-meng/AniDoc)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/pdf/2412.14173)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://yihao-meng.github.io/AniDoc_demo/)\n\n+ [Video Diffusion Transformers are In-Context Learners](https://arxiv.org/abs/2412.10783) (Dec., 2024)  \n  [![Star](https://img.shields.io/github/stars/feizc/Video-In-Context.svg?style=social\u0026label=Star)](https://github.com/feizc/Video-In-Context)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2412.10783)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://huggingface.co/feizhengcong/Video-In-Context)\n\n+ [Track4Gen: Teaching Video Diffusion Models to Track Points Improves Video Generation](https://arxiv.org/abs/2412.06016) (Dec., 2024 | CVPR 2025)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2412.06016)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://hyeonho99.github.io/track4gen/)\n\n+ [Instructional Video Generation](https://arxiv.org/abs/2412.04189) (Dec., 2024)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2412.04189)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://excitedbutter.github.io/Instructional-Video-Generation/)\n\n+ [Mimir: Improving Video Diffusion Models for Precise Text Understanding](https://arxiv.org/abs/2412.03085) (Dec., 2024)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2412.03085)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://lucaria-academy.github.io/Mimir/)\n\n+ [Spatiotemporal Skip Guidance for Enhanced Video Diffusion Sampling](https://arxiv.org/abs/2411.18664) (Dec., 2024)  \n  [![Star](https://img.shields.io/github/stars/junhahyung/STGuidance.svg?style=social\u0026label=Star)](https://github.com/junhahyung/STGuidance)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2411.18664)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://junhahyung.github.io/STGuidance)\n\n+ [Identity-Preserving Text-to-Video Generation by Frequency Decomposition](https://arxiv.org/abs/2411.17440) (Nov., 2024)      \n  [![Star](https://img.shields.io/github/stars/PKU-YuanGroup/ConsisID.svg?style=social\u0026label=Star)](https://github.com/PKU-YuanGroup/ConsisID)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2411.17440)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://pku-yuangroup.github.io/ConsisID/) \n  [![Dataset](https://img.shields.io/badge/Dataset-e97451)](https://huggingface.co/datasets/BestWishYsh/ConsisID-preview-Data)\n\n+ [WF-VAE: Enhancing Video VAE by Wavelet-Driven Energy Flow for Latent Video Diffusion Model](https://arxiv.org/abs/2411.17459) (Nov., 2024)  \n  [![Star](https://img.shields.io/github/stars/PKU-YuanGroup/WF-VAE.svg?style=social\u0026label=Star)](https://github.com/PKU-YuanGroup/WF-VAE)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2411.17459)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://video-repair.github.io/)\n\n+ [VideoRepair: Improving Text-to-Video Generation via Misalignment Evaluation and Localized Refinement](https://arxiv.org/pdf/2411.15115) (Nov., 2024)  \n  [![Star](https://img.shields.io/github/stars/daeunni/VideoRepair.svg?style=social\u0026label=Star)](https://github.com/daeunni/VideoRepair)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/pdf/2411.15115)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://video-repair.github.io/)\n\n+ [Enhancing Motion in Text-to-Video Generation with Decomposed Encoding and Conditioning](https://arxiv.org/abs/2410.24219) (Oct., 2024 | NeurIPS 2024)  \n  [![Star](https://img.shields.io/github/stars/PR-Ryan/DEMO.svg?style=social\u0026label=Star)](https://github.com/PR-Ryan/DEMO)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2410.24219)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://pr-ryan.github.io/DEMO-project/)\n\n+ [Improved Video VAE for Latent Video Diffusion Model](https://arxiv.org/abs/2411.06449) (Oct., 2024)      \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2411.06449)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://wpy1999.github.io/IV-VAE/)\n\n+ [VideoAgent: Self-Improving Video Generation](https://arxiv.org/abs/2410.10076)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2410.10076)\n\n+ [T2V-Turbo-v2: Enhancing Video Generation Model Post-Training Through Data, Reward, and Conditional Guidance Design](https://arxiv.org/pdf/2410.05677) (Oct, 2024)      \n  [![Star](https://img.shields.io/github/stars/Ji4chenLi/t2v-turbo.svg?style=social\u0026label=Star)](https://github.com/Ji4chenLi/t2v-turbo)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/pdf/2410.05677)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://t2v-turbo-v2.github.io/)\n\n+ [Progressive Autoregressive Video Diffusion Models](https://arxiv.org/abs/2410.08151) (Oct., 2024)      \n  [![Star](https://img.shields.io/github/stars/desaixie/pa_vdm.svg?style=social\u0026label=Star)](https://github.com/desaixie/pa_vdm)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2410.08151)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://desaixie.github.io/pa-vdm/)\n\n+ [Real-Time Video Generation with Pyramid Attention Broadcast](https://arxiv.org/abs/2408.12588) (Aug., 2024)      \n  [![Star](https://img.shields.io/github/stars/NUS-HPC-AI-Lab/VideoSys.svg?style=social\u0026label=Star)](https://github.com/NUS-HPC-AI-Lab/VideoSys)\n  [![paper](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2408.12588)\n\n+ [xGen-VideoSyn-1: High-fidelity Text-to-Video Synthesis with Compressed Representations](https://arxiv.org/abs/2408.12590) (Aug., 2024)      \n  [![Star](https://img.shields.io/github/stars/SalesforceAIResearch/xgen-videosyn.svg?style=social\u0026label=Star)](https://github.com/SalesforceAIResearch/xgen-videosyn)\n  [![paper](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2408.12590)\n\n+ [CogVideoX: Text-to-video generation](https://github.com/THUDM/CogVideo/blob/main/resources/CogVideoX.pdf) (Aug., 2024)      \n  [![Star](https://img.shields.io/github/stars/THUDM/CogVideo.svg?style=social\u0026label=Star)](https://github.com/THUDM/CogVideo)\n  [![paper](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://github.com/THUDM/CogVideo/blob/main/resources/CogVideoX.pdf)\n\n+ [FreeLong: Training-Free Long Video Generation with SpectralBlend Temporal Attention](https://arxiv.org/abs/2407.19918) (Aug., 2024)      \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2407.19918)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://yulu.net.cn/freelong/)\n  \n+ [VEnhancer: Generative Space-Time Enhancement for Video Generation](https://arxiv.org/abs/2407.07667) (Jul., 2024)      \n  [![Star](https://img.shields.io/github/stars/Vchitect/VEnhancer.svg?style=social\u0026label=Star)](https://github.com/Vchitect/VEnhancer)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2407.07667)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://vchitect.github.io/VEnhancer-project/)\n\n+ [Live2Diff: Live Stream Translation via Uni-directional Attention in Video Diffusion Models](https://arxiv.org/abs/2407.08701) (Jul., 2024)      \n  [![Star](https://img.shields.io/github/stars/open-mmlab/Live2Diff.svg?style=social\u0026label=Star)](https://github.com/open-mmlab/Live2Diff)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2407.08701)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://live2diff.github.io/)\n\n+ [Video Diffusion Alignment via Reward Gradient](https://arxiv.org/abs/2407.08737) (Jul., 2024)      \n  [![Star](https://img.shields.io/github/stars/mihirp1998/VADER.svg?style=social\u0026label=Star)](https://github.com/mihirp1998/VADER)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2407.08737)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://vader-vid.github.io/)\n\n+ [ExVideo: Extending Video Diffusion Models via Parameter-Efficient Post-Tuning](https://arxiv.org/abs/2406.14130) (Jun., 2024)      \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2406.14130)\n\n+ [MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance](https://arxiv.org/abs/2406.19680) (Jul., 2024)      \n  [![Star](https://img.shields.io/github/stars/Tencent/MimicMotion.svg?style=social\u0026label=Star)](https://github.com/Tencent/MimicMotion)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2406.19680)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://tencent.github.io/MimicMotion/)\n\n+ [Identifying and Solving Conditional Image Leakage in Image-to-Video Diffusion Model](https://arxiv.org/abs/2406.15735) (Jun., 2024)   \n  [![Star](https://img.shields.io/github/stars/thu-ml/cond-image-leakage.svg?style=social\u0026label=Star)](https://github.com/thu-ml/cond-image-leakage/tree/main?tab=readme-ov-file)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2406.15735)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://cond-image-leak.github.io/)\n\n+ [Video-Infinity: Distributed Long Video Generation](https://arxiv.org/abs/2406.16260) (Jun., 2024)      \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2406.16260)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://video-infinity.tanzhenxiong.com/)\n\n+ [MotionBooth: Motion-Aware Customized Text-to-Video Generation](https://arxiv.org/abs/2406.17758) (Jun., 2024)      \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2406.17758)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://jianzongwu.github.io/projects/motionbooth/)\n\n+ [Text-Animator: Controllable Visual Text Video Generation](https://arxiv.org/abs/2406.17777) (Jun., 2024)      \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2406.17777)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://laulampaul.github.io/text-animator.html)\n\n+ [UniAnimate: Taming Unified Video Diffusion Models for Consistent Human Image Animation](https://arxiv.org/abs/2406.01188) (Jun., 2024)      \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2406.01188)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://unianimate.github.io/)\n\n+ [T2V-Turbo: Breaking the Quality Bottleneck of Video Consistency Model with Mixed Reward Feedback](https://arxiv.org/abs/2405.18750) (May, 2024)      \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2405.18750)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://t2v-turbo.github.io/)\n\n+ [Collaborative Video Diffusion: Consistent Multi-video Generation with Camera Control](https://arxiv.org/abs/2405.17414) (May, 2024)      \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2405.17414)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://collaborativevideodiffusion.github.io/)\n\n+ [Human4DiT: Free-view Human Video Generation with 4D Diffusion Transformer](https://arxiv.org/abs/2405.17405) (May, 2024)      \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2405.17405)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://human4dit.github.io/)\n\n+ [FIFO-Diffusion: Generating Infinite Videos from Text without Training](https://arxiv.org/abs/2405.11473) (May, 2024)      \n  [![Star](https://img.shields.io/github/stars/jjihwan/FIFO-Diffusion_public.svg?style=social\u0026label=Star)](https://github.com/jjihwan/FIFO-Diffusion_public)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2405.11473)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://jjihwan.github.io/projects/FIFO-Diffusion)\n\n+ [Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models](https://arxiv.org/abs/2405.04233) (May, 2024)      \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2405.04233)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://www.shengshu-ai.com/vidu)\n\n+ [Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers](https://arxiv.org/abs/2405.05945) (May, 2024)      \n  [![Star](https://img.shields.io/github/stars/Alpha-VLLM/Lumina-T2X.svg?style=social\u0026label=Star)](https://github.com/Alpha-VLLM/Lumina-T2X)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2405.05945)\n\n+ [StoryDiffusion: Consistent Self-Attention for Long-Range Image and Video Generation](https://arxiv.org/abs/2405.01434) (May, 2024)      \n  [![Star](https://img.shields.io/github/stars/HVision-NKU/StoryDiffusion.svg?style=social\u0026label=Star)](https://github.com/HVision-NKU/StoryDiffusion)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2405.01434)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://storydiffusion.github.io/)\n\n+ [TI2V-Zero: Zero-Shot Image Conditioning for Text-to-Video Diffusion Models](https://arxiv.org/abs/2404.16306) (CVPR 2024)      \n  [![Star](https://img.shields.io/github/stars/merlresearch/TI2V-Zero.svg?style=social\u0026label=Star)](https://github.com/merlresearch/TI2V-Zero)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2404.16306)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://merl.com/research/highlights/TI2V-Zero)\n\n+ [ID-Animator: Zero-Shot Identity-Preserving Human Video Generation](https://arxiv.org/abs/2404.15275) (Apr., 2024)  \n  [![Star](https://img.shields.io/github/stars/ID-Animator/ID-Animator.svg?style=social\u0026label=Star)](https://github.com/ID-Animator/ID-Animator) \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2404.15275)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://id-animator.github.io/)\n\n+ [AnimateZoo: Zero-shot Video Generation of Cross-Species Animation via Subject Alignment](https://arxiv.org/abs/2404.04946) (Apr., 2024)  \n  [![Star](https://img.shields.io/github/stars/JustinXu0/AnimateZoo.svg?style=social\u0026label=Star)](https://github.com/JustinXu0/AnimateZoo) \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2404.04946)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://justinxu0.github.io/AnimateZoo/)\n\n+ [MagicTime: Time-lapse Video Generation Models as Metamorphic Simulators](https://arxiv.org/abs/2404.05014) (Apr., 2024)      \n  [![Star](https://img.shields.io/github/stars/PKU-YuanGroup/MagicTime.svg?style=social\u0026label=Star)](https://github.com/PKU-YuanGroup/MagicTime)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2404.05014)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://pku-yuangroup.github.io/MagicTime/) \n  [![Dataset](https://img.shields.io/badge/Dataset-e97451)](https://huggingface.co/datasets/BestWishYsh/ChronoMagic) \n\n+ [TRIP: Temporal Residual Learning with Image Noise Prior for Image-to-Video Diffusion Models](https://arxiv.org/abs/2403.17005) (CVPR 2024)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2403.17005)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://trip-i2v.github.io/TRIP/)\n\n+ [VSTAR: Generative Temporal Nursing for Longer Dynamic Video Synthesis](https://arxiv.org/abs/2403.13501) (Mar., 2024)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2403.13501)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://yumengli007.github.io/VSTAR/)\n\n+ [StreamingT2V: Consistent, Dynamic, and Extendable Long Video Generation from Text](https://arxiv.org/abs/2403.14773) (Mar., 2024)  \n  [![Star](https://img.shields.io/github/stars/Picsart-AI-Research/StreamingT2V.svg?style=social\u0026label=Star)](https://github.com/Picsart-AI-Research/StreamingT2V)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2403.14773)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://streamingt2v.github.io/)\n\n+ [Intention-driven Ego-to-Exo Video Generation](https://arxiv.org/abs/2403.09194) (Mar., 2024)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2403.09194)\n\n+ [VideoElevator: Elevating Video Generation Quality with Versatile Text-to-Image Diffusion Models](https://arxiv.org/abs/2403.05438) (Mar., 2024)  \n  [![Star](https://img.shields.io/github/stars/YBYBZhang/VideoElevator.svg?style=social\u0026label=Star)](https://github.com/YBYBZhang/VideoElevator)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2403.05438)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://videoelevator.github.io/)\n\n+ [Snap Video: Scaled Spatiotemporal Transformers for Text-to-Video Synthesis](https://arxiv.org/abs/2402.14797) (Feb., 2024)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2402.14797)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://snap-research.github.io/snapvideo/)\n\n+ [One-Shot Motion Customization of Text-to-Video Diffusion Models](https://arxiv.org/abs/2402.14780) (Feb., 2024)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2402.14780)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://anonymous-314.github.io/)\n\n+ [Magic-Me: Identity-Specific Video Customized Diffusion](https://arxiv.org/abs/2402.09368) (Feb., 2024)  \n  [![Star](https://img.shields.io/github/stars/Zhen-Dong/Magic-Me.svg?style=social\u0026label=Star)](https://github.com/Zhen-Dong/Magic-Me)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2402.09368)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://magic-me-webpage.github.io/)\n\n+ [ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation](https://arxiv.org/abs/2402.04324) (Feb., 2024)  \n  [![Star](https://img.shields.io/github/stars/TIGER-AI-Lab/ConsistI2V.svg?style=social\u0026label=Star)](https://github.com/TIGER-AI-Lab/ConsistI2V)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2402.04324)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://tiger-ai-lab.github.io/ConsistI2V/)\n\n+ [Direct-a-Video: Customized Video Generation with User-Directed Camera Movement and Object Motion](https://arxiv.org/abs/2402.03162) (Feb., 2024)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2402.03162)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://direct-a-video.github.io/)\n\n+ [Video-LaVIT: Unified Video-Language Pre-training with Decoupled Visual-Motional Tokenization](https://arxiv.org/abs/2402.03161) (Feb., 2024)  \n  [![Star](https://img.shields.io/github/stars/jy0205/LaVIT.svg?style=social\u0026label=Star)](https://github.com/jy0205/LaVIT)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2402.03161)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://video-lavit.github.io/)\n\n+ [Boximator: Generating Rich and Controllable Motions for Video Synthesis](https://arxiv.org/abs/2402.01566) (Feb., 2024)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2402.01566)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://boximator.github.io/)\n\n+ [Lumiere: A Space-Time Diffusion Model for Video Generation](https://arxiv.org/abs/2401.12945) (Jan., 2024)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2401.12945)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://lumiere-video.github.io/)\n\n+ [ActAnywhere: Subject-Aware Video Background Generation](https://arxiv.org/abs/2401.10822) (Jan., 2024)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2401.10822)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://actanywhere.github.io/)\n\n+ [WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens](https://arxiv.org/abs/2401.09985) (Jan., 2024)  \n  [![Star](https://img.shields.io/github/stars/JeffWang987/WorldDreamer.svg?style=social\u0026label=Star)](https://github.com/JeffWang987/WorldDreamer)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2401.09985)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://world-dreamer.github.io/)\n\n+ [CustomVideo: Customizing Text-to-Video Generation with Multiple Subjects](https://arxiv.org/abs/2401.09962) (Jan., 2024)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2401.09962)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://kyfafyd.wang/projects/customvideo/)\n\n+ [UniVG: Towards UNIfied-modal Video Generation](https://arxiv.org/abs/2401.09084) (Jan., 2024)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2401.09084)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://univg-baidu.github.io/)\n\n+ [VideoCrafter2: Overcoming Data Limitations for High-Quality Video Diffusion Models](https://arxiv.org/abs/2401.09047) (Jan., 2024)  \n  [![Star](https://img.shields.io/github/stars/AILab-CVC/VideoCrafter.svg?style=social\u0026label=Star)](https://github.com/AILab-CVC/VideoCrafter)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2401.09047)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://ailab-cvc.github.io/videocrafter2/)\n\n+ [360DVD: Controllable Panorama Video Generation with 360-Degree Video Diffusion Model](https://arxiv.org/abs/2401.06578) (Jan., 2024)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2401.06578)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://akaneqwq.github.io/360DVD/)\n\n+ [RAVEN: Rethinking Adversarial Video Generation with Efficient Tri-plane Networks](https://arxiv.org/abs/2401.06035) (Jan., 2024)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2401.06035)\n\n+ [Latte: Latent Diffusion Transformer for Video Generation](https://arxiv.org/abs/2401.03048) (Jan., 2024)  \n  [![Star](https://img.shields.io/github/stars/Vchitect/Latte.svg?style=social\u0026label=Star)](https://github.com/Vchitect/Latte)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2401.03048)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://maxin-cn.github.io/latte_project/)\n\n+ [MagicVideo-V2: Multi-Stage High-Aesthetic Video Generation](https://arxiv.org/abs/2401.04468) (Jan., 2024)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2401.04468)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://magicvideov2.github.io/)\n\n+ [VideoDrafter: Content-Consistent Multi-Scene Video Generation with LLM](https://arxiv.org/abs/2401.01256) (Jan., 2024)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2401.01256)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://videodrafter.github.io/)\n\n+ [FlashVideo: A Framework for Swift Inference in Text-to-Video Generation](https://arxiv.org/abs/2401.00869) (Dec., 2023)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2401.00869)\n\n+ [I2V-Adapter: A General Image-to-Video Adapter for Video Diffusion Models](https://arxiv.org/abs/2312.16693) (Dec., 2023)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2312.16693)\n\n+ [A Recipe for Scaling up Text-to-Video Generation with Text-free Videos](https://arxiv.org/abs/2312.15770) (Dec., 2023)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2312.15770)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://tf-t2v.github.io/)\n\n+ [PIA: Your Personalized Image Animator via Plug-and-Play Modules in Text-to-Image Models](https://arxiv.org/abs/2312.13964) (Dec., 2023)  \n  [![Star](https://img.shields.io/github/stars/open-mmlab/PIA.svg?style=social\u0026label=Star)](https://github.com/open-mmlab/PIA)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2312.13964)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://pi-animator.github.io/)\n\n+ [VideoPoet: A Large Language Model for Zero-Shot Video Generation](https://arxiv.org/abs/2312.14125) (Dec., 2023)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2312.14125)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://sites.research.google/videopoet/)\n\n+ [InstructVideo: Instructing Video Diffusion Models with Human Feedback](https://arxiv.org/abs/2312.12490) (Dec., 2023)  \n  [![Star](https://img.shields.io/github/stars/damo-vilab/i2vgen-xl.svg?style=social\u0026label=Star)](https://github.com/damo-vilab/i2vgen-xl/blob/main/doc/InstructVideo.md)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2312.12490)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://instructvideo.github.io/)\n\n+ [VideoLCM: Video Latent Consistency Model](https://arxiv.org/abs/2312.09109) (Dec., 2023)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2312.09109)\n\n+ [PEEKABOO: Interactive Video Generation via Masked-Diffusion](https://arxiv.org/abs/2312.07509) (Dec., 2023)  \n  [![Star](https://img.shields.io/github/stars/microsoft/Peekaboo.svg?style=social\u0026label=Star)](https://github.com/microsoft/Peekaboo)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2312.07509)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://jinga-lala.github.io/projects/Peekaboo/)\n\n+ [FreeInit: Bridging Initialization Gap in Video Diffusion Models](https://arxiv.org/abs/2312.07537) (Dec., 2023)  \n  [![Star](https://img.shields.io/github/stars/TianxingWu/FreeInit.svg?style=social\u0026label=Star)](https://github.com/TianxingWu/FreeInit)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2312.07537)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://tianxingwu.github.io/pages/FreeInit/)\n\n+ [Photorealistic Video Generation with Diffusion Models](https://arxiv.org/abs/2312.06662) (Dec., 2023)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2312.06662)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://walt-video-diffusion.github.io/)\n\n+ [Upscale-A-Video: Temporal-Consistent Diffusion Model for Real-World Video Super-Resolution](https://arxiv.org/abs/2312.06640) (Dec., 2023)  \n  [![Star](https://img.shields.io/github/stars/sczhou/Upscale-A-Video.svg?style=social\u0026label=Star)](https://github.com/sczhou/Upscale-A-Video)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2312.06640)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://shangchenzhou.com/projects/upscale-a-video/)\n\n+ [DreaMoving: A Human Video Generation Framework based on Diffusion Models](https://arxiv.org/abs/2312.05107) (Dec., 2023)  \n  [![Star](https://img.shields.io/github/stars/dreamoving/dreamoving-project.svg?style=social\u0026label=Star)](https://github.com/dreamoving/dreamoving-project)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2312.05107)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://dreamoving.github.io/dreamoving/)\n\n+ [MotionCrafter: One-Shot Motion Customization of Diffusion Models](https://arxiv.org/abs/2312.05288) (Dec., 2023)  \n  [![Star](https://img.shields.io/github/stars/zyxElsa/MotionCrafter.svg?style=social\u0026label=Star)](https://github.com/zyxElsa/MotionCrafter)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2312.05288)\n\n+ [AnimateZero: Video Diffusion Models are Zero-Shot Image Animators](https://arxiv.org/abs/2312.03793) (Dec., 2023)  \n  [![Star](https://img.shields.io/github/stars/vvictoryuki/AnimateZero.svg?style=social\u0026label=Star)](https://github.com/vvictoryuki/AnimateZero)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2312.03793)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://vvictoryuki.github.io/animatezero.github.io/)\n\n+ [AVID: Any-Length Video Inpainting with Diffusion Model](https://arxiv.org/abs/2312.03816) (Dec., 2023)  \n  [![Star](https://img.shields.io/github/stars/zhang-zx/AVID.svg?style=social\u0026label=Star)](https://github.com/zhang-zx/AVID)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2312.03816)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://zhang-zx.github.io/AVID/)\n\n+ [MTVG : Multi-text Video Generation with Text-to-Video Models](https://arxiv.org/abs/2312.04086) (Dec., 2023)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2312.04086)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://kuai-lab.github.io/mtvg-page)\n\n+ [DreamVideo: Composing Your Dream Videos with Customized Subject and Motion](https://arxiv.org/abs/2312.04433) (Dec., 2023)  \n  [![Star](https://img.shields.io/github/stars/damo-vilab/i2vgen-xl.svg?style=social\u0026label=Star)](https://github.com/damo-vilab/i2vgen-xl)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2312.04433)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://dreamvideo-t2v.github.io/)\n\n+ [Hierarchical Spatio-temporal Decoupling for Text-to-Video Generation](https://arxiv.org/abs/2312.04483) (Dec., 2023)  \n  [![Star](https://img.shields.io/github/stars/damo-vilab/i2vgen-xl.svg?style=social\u0026label=Star)](https://github.com/damo-vilab/i2vgen-xl)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2312.04483)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://higen-t2v.github.io/)\n\n+ [GenTron: Delving Deep into Diffusion Transformers for Image and Video Generation](https://arxiv.org/abs/2312.04557) (CVPR 2024)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2312.04557)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://www.shoufachen.com/gentron_website/)\n\n+ [GenDeF: Learning Generative Deformation Field for Video Generation](https://arxiv.org/abs/2312.04561) (Dec., 2023)  \n  [![Star](https://img.shields.io/github/stars/aim-uofa/GenDeF.svg?style=social\u0026label=Star)](https://github.com/aim-uofa/GenDeF)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2312.04561)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://aim-uofa.github.io/GenDeF/)\n\n+ [F3-Pruning: A Training-Free and Generalized Pruning Strategy towards Faster and Finer Text-to-Video Synthesis](https://arxiv.org/abs/2312.03459) (Dec., 2023)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2312.03459)\n\n+ [DreamVideo: High-Fidelity Image-to-Video Generation with Image Retention and Text Guidance](https://arxiv.org/abs/2312.03018) (Dec., 2023)  \n  [![Star](https://img.shields.io/github/stars/anonymous0769/DreamVideo.svg?style=social\u0026label=Star)](https://github.com/anonymous0769/DreamVideo)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2312.03018)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://anonymous0769.github.io/DreamVideo/)\n\n+ [LivePhoto: Real Image Animation with Text-guided Motion Control](https://arxiv.org/abs/2312.02928) (Dec., 2023)  \n  [![Star](https://img.shields.io/github/stars/XavierCHEN34/LivePhoto.svg?style=social\u0026label=Star)](https://github.com/XavierCHEN34/LivePhoto)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2312.02928)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://xavierchen34.github.io/LivePhoto-Page/)\n\n+ [Fine-grained Controllable Video Generation via Object Appearance and Context](https://arxiv.org/abs/2312.02919) (Dec., 2023)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2312.02919)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://hhsinping.github.io/factor/)\n\n+ [VideoBooth: Diffusion-based Video Generation with Image Prompts](https://arxiv.org/abs/2312.00777) (Dec., 2023)  \n  [![Star](https://img.shields.io/github/stars/Vchitect/VideoBooth.svg?style=social\u0026label=Star)](https://github.com/Vchitect/VideoBooth)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2312.00777)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://vchitect.github.io/VideoBooth-project/)\n\n+ [StyleCrafter: Enhancing Stylized Text-to-Video Generation with Style Adapter](https://arxiv.org/abs/2312.00330) (Dec., 2023)  \n  [![Star](https://img.shields.io/github/stars/GongyeLiu/StyleCrafter.svg?style=social\u0026label=Star)](https://github.com/GongyeLiu/StyleCrafter)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2312.00330)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://gongyeliu.github.io/StyleCrafter.github.io/)\n\n+ [MicroCinema: A Divide-and-Conquer Approach for Text-to-Video Generation](https://arxiv.org/abs/2311.18829) (Nov., 2023)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2311.18829)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://wangyanhui666.github.io/MicroCinema.github.io/)\n\n+ [ART•V: Auto-Regressive Text-to-Video Generation with Diffusion Models](https://arxiv.org/abs/2311.18834) (Nov., 2023)  \n  [![Star](https://img.shields.io/github/stars/WarranWeng/ART.V.svg?style=social\u0026label=Star)](https://github.com/WarranWeng/ART.V)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2311.18834)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://warranweng.github.io/art.v/)\n\n+ [Smooth Video Synthesis with Noise Constraints on Diffusion Models for One-shot Video Tuning](https://arxiv.org/abs/2311.17536) (Nov., 2023)  \n  [![Star](https://img.shields.io/github/stars/SPengLiang/SmoothVideo.svg?style=social\u0026label=Star)](https://github.com/SPengLiang/SmoothVideo)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2311.17536)\n\n+ [VideoAssembler: Identity-Consistent Video Generation with Reference Entities using Diffusion Model](https://arxiv.org/abs/2311.17338) (Nov., 2023)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2311.17338)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://videoassembler.github.io/videoassembler/)\n\n+ [MotionZero:Exploiting Motion Priors for Zero-shot Text-to-Video Generation](https://arxiv.org/abs/2311.16635) (Nov., 2023)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2311.16635)\n\n+ [MagicAnimate: Temporally Consistent Human Image Animation using Diffusion Model](https://arxiv.org/abs/2311.16498) (Nov., 2023)  \n  [![Star](https://img.shields.io/github/stars/magic-research/magic-animate.svg?style=social\u0026label=Star)](https://github.com/magic-research/magic-animate)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2311.16498)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://showlab.github.io/magicanimate)\n\n+ [FlowZero: Zero-Shot Text-to-Video Synthesis with LLM-Driven Dynamic Scene Syntax](https://arxiv.org/abs/2311.15813) (Nov., 2023)  \n  [![Star](https://img.shields.io/github/stars/aniki-ly/FlowZero.svg?style=social\u0026label=Star)](https://github.com/aniki-ly/FlowZero)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2311.15813)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://flowzero-video.github.io/)\n\n+ [Sketch Video Synthesis](https://arxiv.org/abs/2311.15306) (Nov., 2023)  \n  [![Star](https://img.shields.io/github/stars/yudianzheng/SketchVideo.svg?style=social\u0026label=Star)](https://github.com/yudianzheng/SketchVideo)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2311.15306)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://sketchvideo.github.io/)\n\n+ [Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets](https://arxiv.org/abs/2311.15127) (Nov., 2023)  \n  [![Star](https://img.shields.io/github/stars/Stability-AI/generative-models.svg?style=social\u0026label=Star)](https://github.com/Stability-AI/generative-models)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2311.15127)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://stability.ai/news/stable-video-diffusion-open-ai-video-model)\n\n+ [Decouple Content and Motion for Conditional Image-to-Video Generation](https://arxiv.org/abs/2311.14294) (Nov., 2023)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2311.14294)\n\n+ [FusionFrames: Efficient Architectural Aspects for Text-to-Video Generation Pipeline](https://arxiv.org/abs/2311.13073) (Nov., 2023)  \n  [![Star](https://img.shields.io/github/stars/ai-forever/KandinskyVideo.svg?style=social\u0026label=Star)](https://github.com/ai-forever/KandinskyVideo)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2311.13073)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://ai-forever.github.io/kandinsky-video/)\n\n+ [Fine-Grained Open Domain Image Animation with Motion Guidance](https://arxiv.org/abs/2311.12886) (Nov., 2023)  \n  [![Star](https://img.shields.io/github/stars/alibaba/animate-anything.svg?style=social\u0026label=Star)](https://github.com/alibaba/animate-anything)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2311.12886)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://animationai.github.io/AnimateAnything/)\n\n+ [GPT4Motion: Scripting Physical Motions in Text-to-Video Generation via Blender-Oriented GPT Planning](https://arxiv.org/abs/2311.12631) (Nov., 2023)  \n  [![Star](https://img.shields.io/github/stars/jiaxilv/GPT4Motion.svg?style=social\u0026label=Star)](https://github.com/jiaxilv/GPT4Motion)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2311.12631)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://gpt4motion.github.io/)\n\n+ [MagicDance: Realistic Human Dance Video Generation with Motions \u0026 Facial Expressions Transfer](https://arxiv.org/abs/2311.12052) (Nov., 2023)  \n  [![Star](https://img.shields.io/github/stars/Boese0601/MagicDance.svg?style=social\u0026label=Star)](https://github.com/Boese0601/MagicDance)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2311.12052)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://boese0601.github.io/magicdance/)\n\n+ [MoVideo: Motion-Aware Video Generation with Diffusion Models](https://arxiv.org/abs/2311.11325) (Nov., 2023)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2311.11325)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://jingyunliang.github.io/MoVideo/)\n\n+ [Make Pixels Dance: High-Dynamic Video Generation](https://arxiv.org/abs/2311.10982) (Nov., 2023)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2311.10982)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://makepixelsdance.github.io/)\n\n+ [Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning](https://arxiv.org/abs/2311.10709) (Nov., 2023)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2311.10709)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://emu-video.metademolab.com/)\n  \n+ [Optimal Noise pursuit for Augmenting Text-to-Video Generation](https://arxiv.org/abs/2311.00949) (Nov., 2023)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2311.00949)\n\n+ [VideoDreamer: Customized Multi-Subject Text-to-Video Generation with Disen-Mix Finetuning](https://arxiv.org/abs/2311.00990) (Nov., 2023)  \n  [![Star](https://img.shields.io/github/stars/videodreamer23/videodreamer23.github.io.svg?style=social\u0026label=Star)](https://github.com/videodreamer23/videodreamer23.github.io)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2311.00990)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://videodreamer23.github.io/)\n\n+ [SEINE: Short-to-Long Video Diffusion Model for Generative Transition and Prediction](https://arxiv.org/abs/2310.20700) (Oct., 2023)  \n  [![Star](https://img.shields.io/github/stars/Vchitect/SEINE.svg?style=social\u0026label=Star)](https://github.com/Vchitect/SEINE)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2310.20700)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://vchitect.github.io/SEINE-project/)\n\n+ [FreeNoise: Tuning-Free Longer Video Diffusion Via Noise Rescheduling](https://arxiv.org/abs/2310.15169) (Oct., 2023)  \n  [![Star](https://img.shields.io/github/stars/arthur-qiu/LongerCrafter.svg?style=social\u0026label=Star)](https://github.com/arthur-qiu/LongerCrafter)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2310.15169)\n  [![Website](https://img.shields.io/badge/Website-9cf)](http://haonanqiu.com/projects/FreeNoise.html)\n\n+ [DynamiCrafter: Animating Open-domain Images with Video Diffusion Priors](https://arxiv.org/abs/2310.12190) (Oct., 2023)  \n  [![Star](https://img.shields.io/github/stars/Doubiiu/DynamiCrafter.svg?style=social\u0026label=Star)](https://github.com/Doubiiu/DynamiCrafter)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2310.12190)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://doubiiu.github.io/projects/DynamiCrafter/)\n  \n+ [LAMP: Learn A Motion Pattern for Few-Shot-Based Video Generation](https://arxiv.org/abs/2310.10769) (Oct., 2023)  \n  [![Star](https://img.shields.io/github/stars/RQ-Wu/LAMP.svg?style=social\u0026label=Star)](https://github.com/RQ-Wu/LAMP)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2310.10769)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://rq-wu.github.io/projects/LAMP/) \n\n+ [Show-1: Marrying Pixel and Latent Diffusion Models for Text-to-Video Generation](https://arxiv.org/abs/2309.15818) (Sep., 2023)  \n  [![Star](https://img.shields.io/github/stars/showlab/Show-1.svg?style=social\u0026label=Star)](https://github.com/showlab/Show-1)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2309.15818)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://showlab.github.io/Show-1/) \n\n+ [MotionDirector: Motion Customization of Text-to-Video Diffusion Models](https://arxiv.org/abs/2310.08465) (Sep., 2023)  \n  [![Star](https://img.shields.io/github/stars/showlab/MotionDirector.svg?style=social\u0026label=Star)](https://github.com/showlab/MotionDirector)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2310.08465)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://showlab.github.io/MotionDirector/)\n\n+ [LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models](https://arxiv.org/abs/2309.15103) (Sep., 2023)  \n  [![Star](https://img.shields.io/github/stars/Vchitect/LaVie.svg?style=social\u0026label=Star)](https://github.com/Vchitect/LaVie)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2309.15103)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://vchitect.github.io/LaVie-project/) \n\n+ [Free-Bloom: Zero-Shot Text-to-Video Generator with LLM Director and LDM Animator](https://arxiv.org/abs/2309.14494) (Sep., 2023)  \n  [![Star](https://img.shields.io/github/stars/SooLab/Free-Bloom.svg?style=social\u0026label=Star)](https://github.com/SooLab/Free-Bloom)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2309.14494)\n\n+ [Hierarchical Masked 3D Diffusion Model for Video Outpainting](https://arxiv.org/abs/2309.02119) (Sep., 2023)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2309.02119)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://fanfanda.github.io/M3DDM/) \n\n+ [Reuse and Diffuse: Iterative Denoising for Text-to-Video Generation](https://arxiv.org/abs/2309.03549) (Sep., 2023)  \n  [![Star](https://img.shields.io/github/stars/anonymous0x233/ReuseAndDiffuse.svg?style=social\u0026label=Star)](https://github.com/anonymous0x233/ReuseAndDiffuse)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2309.03549)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://anonymous0x233.github.io/ReuseAndDiffuse/) \n\n+ [VideoGen: A Reference-Guided Latent Diffusion Approach for High Definition Text-to-Video Generation](https://arxiv.org/abs/2309.00398) (Sep., 2023)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2309.00398)\n\n+ [MagicAvatar: Multimodal Avatar Generation and Animation](https://arxiv.org/abs/2308.14748) (Aug., 2023)  \n  [![Star](https://img.shields.io/github/stars/magic-research/magic-avatar.svg?style=social\u0026label=Star)](https://github.com/magic-research/magic-avatar)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2308.14748)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://magic-avatar.github.io/) \n\n+ [Empowering Dynamics-aware Text-to-Video Diffusion with Large Language Models](https://arxiv.org/abs/2308.13812) (Aug., 2023)  \n  [![Star](https://img.shields.io/github/stars/scofield7419/Dysen.svg?style=social\u0026label=Star)](https://github.com/scofield7419/Dysen)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2308.13812)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://haofei.vip/Dysen-VDM/) \n\n+ [SimDA: Simple Diffusion Adapter for Efficient Video Generation](https://arxiv.org/abs/2308.09710) (Aug., 2023)  \n  [![Star](https://img.shields.io/github/stars/ChenHsing/SimDA.svg?style=social\u0026label=Star)](https://github.com/ChenHsing/SimDA)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2308.09710)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://chenhsing.github.io/SimDA/) \n\n+ [ModelScope Text-to-Video Technical Report](https://arxiv.org/abs/2308.06571) (Aug., 2023)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2308.06571)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://modelscope.cn/models/damo/text-to-video-synthesis/summary) \n\n+ [Dual-Stream Diffusion Net for Text-to-Video Generation](https://arxiv.org/abs/2308.08316) (Aug., 2023)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2308.08316)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://anonymous.4open.science/r/Private-C3E8) \n\n+ [InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation](https://arxiv.org/abs/2307.06942) (Jul., 2023)  \n  [![Star](https://img.shields.io/github/stars/OpenGVLab/InternVideo.svg?style=social\u0026label=Star)](https://github.com/OpenGVLab/InternVideo/tree/main/Data/InternVid)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2307.06942)\n\n+ [Animate-A-Story: Storytelling with Retrieval-Augmented Video Generation](https://arxiv.org/abs/2307.06940) (Jul., 2023)  \n  [![Star](https://img.shields.io/github/stars/VideoCrafter/Animate-A-Story.svg?style=social\u0026label=Star)](https://github.com/VideoCrafter/Animate-A-Story)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2307.06940)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://videocrafter.github.io/Animate-A-Story/) \n\n+ [AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning](https://arxiv.org/abs/2307.04725) (Jul., 2023)  \n  [![Star](https://img.shields.io/github/stars/guoyww/animatediff.svg?style=social\u0026label=Star)](https://github.com/guoyww/animatediff/)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2307.04725)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://animatediff.github.io/) \n\n+ [DisCo: Disentangled Control for Referring Human Dance Generation in Real World](https://arxiv.org/abs/2307.000400) (Jul., 2023)  \n  [![Star](https://img.shields.io/github/stars/Wangt-CN/DisCo.svg?style=social\u0026label=Star)](https://github.com/Wangt-CN/DisCo)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2307.00040)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://disco-dance.github.io/) \n\n+ [Learn the Force We Can: Enabling Sparse Motion Control in Multi-Object Video Generation](https://arxiv.org/abs/2306.03988) (Jun., 2023)                                       \n  [![Star](https://img.shields.io/github/stars/araachie/yoda.svg?style=social\u0026label=Star)](https://github.com/araachie/yoda) \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2306.03988)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://araachie.github.io/yoda/) \n\n+ [VideoComposer: Compositional Video Synthesis with Motion Controllability](https://arxiv.org/abs/2306.02018) (Jun., 2023)  \n  [![Star](https://img.shields.io/github/stars/damo-vilab/videocomposer.svg?style=social\u0026label=Star)](https://github.com/damo-vilab/videocomposer)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2306.02018)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://videocomposer.github.io/) \n\n+ [Probabilistic Adaptation of Text-to-Video Models](https://arxiv.org/abs/2306.01872) (Jun., 2023)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2306.01872)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://video-adapter.github.io/video-adapter/) \n\n+ [Make-Your-Video: Customized Video Generation Using Textual and Structural Guidance](https://arxiv.org/abs/2306.00943) (Jun., 2023)  \n  [![Star](https://img.shields.io/github/stars/VideoCrafter/Make-Your-Video.svg?style=social\u0026label=Star)](https://github.com/VideoCrafter/Make-Your-Video)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2306.00943)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://doubiiu.github.io/projects/Make-Your-Video/) \n\n+ [Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising](https://arxiv.org/abs/2305.18264) (May, 2023)  \n  [![Star](https://img.shields.io/github/stars/G-U-N/Gen-L-Video.svg?style=social\u0026label=Star)](https://github.com/G-U-N/Gen-L-Video)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2305.18264)\n  [![Website](https://img.shields.io/badge/Website-9cf)](https://g-u-n.github.io/projects/gen-long-video/index.html) \n\n+ [Cinematic Mindscapes: High-quality Video Reconstruction from Brain Activity](https://arxiv.org/abs/2305.11675) (May, 2023)  \n  [![Star](https://img.shields.io/github/stars/jqin4749/MindVideo.svg?style=social\u0026label=Star)](https://github.com/jqin4749/MindVideo)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2305.11675) \n  [![Website](https://img.shields.io/badge/Website-9cf)](https://mind-video.com/)\n\n+ [Any-to-Any Generation via Composable Diffusion](https://arxiv.org/abs/2305.11846) (May, 2023)  \n  [![Star](https://img.shields.io/github/stars/microsoft/i-Code.svg?style=social\u0026label=Star)](https://github.com/microsoft/i-Code/tree/main/i-Code-V3)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2305.11846) \n  [![Website](https://img.shields.io/badge/Website-9cf)](https://codi-gen.github.io/)\n\n+ [VideoFactory: Swap Attention in Spatiotemporal Diffusions for Text-to-Video Generation](https://arxiv.org/abs/2305.10874) (May, 2023)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2305.10874) \n\n+ [Preserve Your Own Correlation: A Noise Prior for Video Diffusion Models](https://arxiv.org/abs/2305.10474) (May, 2023)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2305.10474) \n  [![Website](https://img.shields.io/badge/Website-9cf)](https://research.nvidia.com/labs/dir/pyoco/)\n\n+ [LaMD: Latent Motion Diffusion for Video Generation](https://arxiv.org/abs/2304.11603) (Apr., 2023)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2304.11603) \n\n+ [Align your Latents: High-Resolution Video Synthesis with Latent Diffusion Models](https://arxiv.org/abs/2304.08818) (CVPR 2023)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2304.08818) \n  [![Website](https://img.shields.io/badge/Website-9cf)](https://research.nvidia.com/labs/toronto-ai/VideoLDM/)\n\n+ [Text2Performer: Text-Driven Human Video Generation](https://arxiv.org/abs/2304.08483) (Apr., 2023)  \n  [![Star](https://img.shields.io/github/stars/yumingj/Text2Performer.svg?style=social\u0026label=Star)](https://github.com/yumingj/Text2Performer)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2304.08483) \n  [![Website](https://img.shields.io/badge/Website-9cf)](https://yumingj.github.io/projects/Text2Performer)\n\n+ [Generative Disco: Text-to-Video Generation for Music Visualization](https://arxiv.org/abs/2304.08551) (Apr., 2023)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2304.08551) \n\n+ [Latent-Shift: Latent Diffusion with Temporal Shift](https://arxiv.org/abs/2304.08477) (Apr., 2023)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2304.08477) \n  [![Website](https://img.shields.io/badge/Website-9cf)](https://latent-shift.github.io/) \n  \n+ [DreamPose: Fashion Image-to-Video Synthesis via Stable Diffusion](https://arxiv.org/abs/2304.06025) (Apr., 2023)  \n  [![Star](https://img.shields.io/github/stars/johannakarras/DreamPose.svg?style=social\u0026label=Star)](https://github.com/johannakarras/DreamPose)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2304.06025) \n  [![Website](https://img.shields.io/badge/Website-9cf)](https://grail.cs.washington.edu/projects/dreampose/)\n\n+ [Follow Your Pose: Pose-Guided Text-to-Video Generation using Pose-Free Videos](https://arxiv.org/abs/2304.01186) (Apr., 2023)  \n  [![Star](https://img.shields.io/github/stars/mayuelala/FollowYourPose.svg?style=social\u0026label=Star)](https://github.com/mayuelala/FollowYourPose)\n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2304.01186) \n  [![Website](https://img.shields.io/badge/Website-9cf)](https://follow-your-pose.github.io/) \n\n+ [Physics-Driven Diffusion Models for Impact Sound Synthesis from Videos](https://arxiv.org/abs/2303.16897) (CVPR 2023)  \n  [![Star](https://img.shields.io/github/stars/sukun1045/video-physics-sound-diffusion.svg?style=social\u0026label=Star)](https://github.com/sukun1045/video-physics-sound-diffusion) \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2303.16897) \n  [![Website](https://img.shields.io/badge/Website-9cf)](https://sukun1045.github.io/video-physics-sound-diffusion/) \n\n+ [Seer: Language Instructed Video Prediction with Latent Diffusion Models](https://arxiv.org/abs/2303.14897) (Mar., 2023)  \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2303.14897) \n  [![Website](https://img.shields.io/badge/Website-9cf)](https://seervideodiffusion.github.io/) \n\n+ [Text2video-Zero: Text-to-Image Diffusion Models Are Zero-Shot Video Generators](https://arxiv.org/abs/2303.13439) (Mar., 2023)   \n  [![Star](https://img.shields.io/github/stars/Picsart-AI-Research/Text2Video-Zero.svg?style=social\u0026label=Star)](https://github.com/Picsart-AI-Research/Text2Video-Zero) \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2303.13439) \n  [![Website](https://img.shields.io/badge/Website-9cf)](https://text2video-zero.github.io/) \n\n+ [Conditional Image-to-Video Generation with Latent Flow Diffusion Models](https://arxiv.org/abs/2303.13744) (CVPR 2023)   \n  [![Star](https://img.shields.io/github/stars/nihaomiao/CVPR23_LFDM.svg?style=social\u0026label=Star)](https://github.com/nihaomiao/CVPR23_LFDM) \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2303.13744)\n\n+ [Decomposed Diffusion Models for High-Quality Video Generation](https://arxiv.org/abs/2303.08320) (CVPR 2023)   \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2303.08320) \n  [![Website](https://img.shields.io/badge/Website-9cf)](https://modelscope.cn/models/damo/text-to-video-synthesis/summary) \n\n+ [Video Probabilistic Diffusion Models in Projected Latent Space](https://arxiv.org/abs/2302.07685) (CVPR 2023)   \n  [![Star](https://img.shields.io/github/stars/sihyun-yu/PVDM.svg?style=social\u0026label=Star)](https://github.com/sihyun-yu/PVDM) \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2302.07685) \n  [![Website](https://img.shields.io/badge/Website-9cf)](https://sihyun.me/PVDM/) \n\n+ [Learning 3D Photography Videos via Self-supervised Diffusion on Single Images](https://arxiv.org/abs/2302.10781) (Feb., 2023)   \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2302.10781)\n\n+ [Structure and Content-Guided Video Synthesis With Diffusion Models](https://arxiv.org/abs/2302.03011) (Feb., 2023)   \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2302.03011) \n  [![Website](https://img.shields.io/badge/Website-9cf)](https://research.runwayml.com/gen2) \n\n+ [Tune-A-Video: One-Shot Tuning of Image Diffusion Models for Text-to-Video Generation](https://arxiv.org/abs/2212.11565) (ICCV 2023)   \n  [![Star](https://img.shields.io/github/stars/showlab/Tune-A-Video?style=social)](https://github.com/showlab/Tune-A-Video) \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2212.11565) \n  [![Website](https://img.shields.io/badge/Website-9cf)](https://tuneavideo.github.io/) \n\n+ [Mm-Diffusion: Learning Multi-Modal Diffusion Models for Joint Audio and Video Generation](https://arxiv.org/abs/2212.09478) (CVPR 2023)   \n  [![Star](https://img.shields.io/github/stars/researchmm/MM-Diffusion.svg?style=social\u0026label=Star)](https://github.com/researchmm/MM-Diffusion) \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2212.09478)\n\n+ [Magvit: Masked Generative Video Transformer](https://arxiv.org/abs/2212.05199) (Dec., 2022)    \n  [![Star](https://img.shields.io/github/stars/MAGVIT/magvit.svg?style=social\u0026label=Star)](https://github.com/MAGVIT/magvit) \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2212.05199) \n  [![Website](https://img.shields.io/badge/Website-9cf)](https://magvit.cs.cmu.edu/) \n\n+ [VIDM: Video Implicit Diffusion Models](https://arxiv.org/abs/2212.00235) (AAAI 2023)   \n  [![Star](https://img.shields.io/github/stars/MKFMIKU/VIDM.svg?style=social\u0026label=Star)](https://github.com/MKFMIKU/VIDM) \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2212.00235) \n  [![Website](https://img.shields.io/badge/Website-9cf)](https://kfmei.page/vidm/) \n\n+ [Efficient Video Prediction via Sparsely Conditioned Flow Matching](https://arxiv.org/abs/2211.14575) (Nov., 2022)   \n  [![Star](https://img.shields.io/github/stars/araachie/river.svg?style=social\u0026label=Star)](https://github.com/araachie/river) \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2211.14575) \n  [![Website](https://img.shields.io/badge/Website-9cf)](https://araachie.github.io/river/)\n\n+ [Latent Video Diffusion Models for High-Fidelity Video Generation With Arbitrary Lengths](https://arxiv.org/abs/2211.13221) (Nov., 2022)   \n  [![Star](https://img.shields.io/github/stars/YingqingHe/LVDM.svg?style=social\u0026label=Star)](https://github.com/YingqingHe/LVDM) \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2211.13221) \n  [![Website](https://img.shields.io/badge/Website-9cf)](https://yingqinghe.github.io/LVDM/)\n\n+ [SinFusion: Training Diffusion Models on a Single Image or Video](https://arxiv.org/abs/2211.11743) (Nov., 2022)   \n  [![Star](https://img.shields.io/github/stars/YingqingHe/LVDM.svg?style=social\u0026label=Star)](https://github.com/yanivnik/sinfusion-code) \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2211.11743) \n  [![Website](https://img.shields.io/badge/Website-9cf)](https://yanivnik.github.io/sinfusion/)\n\n+ [MagicVideo: Efficient Video Generation With Latent Diffusion Models](https://arxiv.org/abs/2211.11018) (Nov., 2022)   \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2211.11018) \n  [![Website](https://img.shields.io/badge/Website-9cf)](https://magicvideo.github.io/#)\n\n+ [Imagen Video: High Definition Video Generation With Diffusion Models](https://arxiv.org/abs/2210.02303) (Oct., 2022)   \n  [![arXiv](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2210.02303) \n  [![Website](https://img.shields.io/badge/Website-9cf)](https://imagen.research.google/video/)\n\n+ [Make-A-Video: Text-to-Video","projects_url":"https://awesome.ecosyste.ms/api/v1/lists/showlab%2Fawesome-video-diffusion/projects"}