{"id":30065797,"url":"https://github.com/skalskip/top-cvpr-2025-papers","last_synced_at":"2025-08-08T06:37:02.257Z","repository":{"id":296582359,"uuid":"993864981","full_name":"SkalskiP/top-cvpr-2025-papers","owner":"SkalskiP","description":"About This repository is a curated collection of the most exciting and influential CVPR 2025 papers. 🔥 [Paper + Code + Demo]","archived":false,"fork":false,"pushed_at":"2025-06-16T18:47:21.000Z","size":168,"stargazers_count":735,"open_issues_count":2,"forks_count":42,"subscribers_count":12,"default_branch":"master","last_synced_at":"2025-07-30T19:32:14.128Z","etag":null,"topics":["computer-vision","cvpr","cvpr2025","image-segmentation","multimodal","object-detection","paper","transformers","vision-and-language","vision-language-model"],"latest_commit_sha":null,"homepage":"","language":"Python","has_issues":true,"has_wiki":null,"has_pages":null,"mirror_url":null,"source_name":null,"license":"cc0-1.0","status":null,"scm":"git","pull_requests_enabled":true,"icon_url":"https://github.com/SkalskiP.png","metadata":{"files":{"readme":"README.md","changelog":null,"contributing":"CONTRIBUTING.md","funding":null,"license":"LICENSE","code_of_conduct":null,"threat_model":null,"audit":null,"citation":null,"codeowners":null,"security":null,"support":null,"governance":null,"roadmap":null,"authors":null,"dei":null,"publiccode":null,"codemeta":null,"zenodo":null}},"created_at":"2025-05-31T17:29:47.000Z","updated_at":"2025-07-30T17:52:33.000Z","dependencies_parsed_at":"2025-06-01T06:01:19.128Z","dependency_job_id":"a64ac455-0c7e-49a2-9c51-d630be4fca3c","html_url":"https://github.com/SkalskiP/top-cvpr-2025-papers","commit_stats":null,"previous_names":["skalskip/top-cvpr-2025-papers"],"tags_count":0,"template":false,"template_full_name":null,"purl":"pkg:github/SkalskiP/top-cvpr-2025-papers","repository_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/SkalskiP%2Ftop-cvpr-2025-papers","tags_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/SkalskiP%2Ftop-cvpr-2025-papers/tags","releases_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/SkalskiP%2Ftop-cvpr-2025-papers/releases","manifests_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/SkalskiP%2Ftop-cvpr-2025-papers/manifests","owner_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/owners/SkalskiP","download_url":"https://codeload.github.com/SkalskiP/top-cvpr-2025-papers/tar.gz/refs/heads/master","sbom_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/SkalskiP%2Ftop-cvpr-2025-papers/sbom","host":{"name":"GitHub","url":"https://github.com","kind":"github","repositories_count":269378055,"owners_count":24407305,"icon_url":"https://github.com/github.png","version":null,"created_at":"2022-05-30T11:31:42.601Z","updated_at":"2022-07-04T15:15:14.044Z","status":"online","status_checked_at":"2025-08-08T02:00:09.200Z","response_time":72,"last_error":null,"robots_txt_status":"success","robots_txt_updated_at":"2025-07-24T06:49:26.215Z","robots_txt_url":"https://github.com/robots.txt","online":true,"can_crawl_api":true,"host_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub","repositories_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories","repository_names_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repository_names","owners_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/owners"}},"keywords":["computer-vision","cvpr","cvpr2025","image-segmentation","multimodal","object-detection","paper","transformers","vision-and-language","vision-language-model"],"created_at":"2025-08-08T06:37:01.214Z","updated_at":"2025-08-08T06:37:02.239Z","avatar_url":"https://github.com/SkalskiP.png","language":"Python","funding_links":[],"categories":[],"sub_categories":[],"readme":"![visitor badge](https://visitor-badge.laobi.icu/badge?page_id=SkalskiP.top-cvpr-2025-papers)\n\n\u003cdiv align=\"center\"\u003e\n  \u003ch1 align=\"center\"\u003etop CVPR 2025 papers\u003c/h1\u003e\n  \u003ca href=\"https://github.com/SkalskiP/top-cvpr-2023-papers\"\u003e2023\u003c/a\u003e | \u003ca href=\"https://github.com/SkalskiP/top-cvpr-2024-papers\"\u003e2024\u003c/a\u003e | \u003ca href=\"https://github.com/SkalskiP/top-cvpr-2025-papers\"\u003e2025\u003c/a\u003e\n\u003c/div\u003e\n\n\u003cbr\u003e\n\n\u003cdiv align=\"center\"\u003e\n  \u003cimg width=\"600\" src=\"https://storage.googleapis.com/com-roboflow-marketing/cvpr-2025-posters/IMG_5342_.JPG\" /\u003e\n\u003c/div\u003e\n\n## 👋 hello\n\nComputer Vision and Pattern Recognition is a massive conference. In **2025** alone,\n**13,008** papers were submitted, and **2,878** were accepted. I created this repository\nto help you search for crème de la crème of CVPR publications. If the paper you are\nlooking for is not on my short list, take a peek at the full\n[list](https://cvpr.thecvf.com/Conferences/2025/AcceptedPapers) of accepted papers.\n\n## 🗞️ papers and posters\n\n*🔥 - highlighted papers*\n\n\u003c!--- AUTOGENERATED_PAPERS_LIST --\u003e\n\u003c!---\n   WARNING: DO NOT EDIT THIS LIST MANUALLY. IT IS AUTOMATICALLY GENERATED.\n   HEAD OVER TO https://github.com/SkalskiP/top-cvpr-2024-papers/blob/master/CONTRIBUTING.md FOR MORE DETAILS ON HOW TO MAKE CHANGES PROPERLY.\n--\u003e\n### 3d vision\n\n\u003cp align=\"left\"\u003e\n    \u003ca href=\"https://cvpr.thecvf.com/media/PosterPDFs/CVPR%202025/33969.png?t=1748740040.9726639\" title=\"VGGT: Visual Geometry Grounded Transformer\"\u003e\n        \u003cimg src=\"https://storage.googleapis.com/com-roboflow-marketing/cvpr-2025-posters/33969.png\" alt=\"VGGT: Visual Geometry Grounded Transformer\" width=\"400px\" align=\"left\" /\u003e\n    \u003c/a\u003e\n    \u003ca href=\"https://arxiv.org/abs/2503.11651\" title=\"VGGT: Visual Geometry Grounded Transformer\"\u003e\n        \u003cstrong\u003e🔥 VGGT: Visual Geometry Grounded Transformer\u003c/strong\u003e\n    \u003c/a\u003e\n    \u003cbr/\u003e\n    Jianyuan Wang, Minghao Chen, Nikita Karaev, Andrea Vedaldi, Christian Rupprecht, David Novotny\n    \u003cbr/\u003e\n    [\u003ca href=\"https://arxiv.org/abs/2503.11651\"\u003epaper\u003c/a\u003e] [\u003ca href=\"https://github.com/facebookresearch/vggt\"\u003ecode\u003c/a\u003e] [\u003ca href=\"https://youtu.be/7ZYwJEpCUUA\"\u003evideo\u003c/a\u003e] [\u003ca href=\"https://huggingface.co/spaces/facebook/vggt\"\u003edemo\u003c/a\u003e] \n    \u003cbr/\u003e\n    \u003cstrong\u003eTopic:\u003c/strong\u003e 3D Vision\n    \u003cbr/\u003e\n    \u003cstrong\u003eSession:\u003c/strong\u003e Fri 13 Jun 2 p.m. PDT — 4 p.m. PDT Poster Session 2 #86\n\u003c/p\u003e\n\u003cbr/\u003e\n\u003cbr/\u003e\n\n\n\u003cp align=\"left\"\u003e\n    \u003ca href=\"https://cvpr.thecvf.com/media/PosterPDFs/CVPR%202025/34871.png?t=1748708079.0490072\" title=\"MASt3R-SLAM: Real-Time Dense SLAM with 3D Reconstruction Priors\"\u003e\n        \u003cimg src=\"https://storage.googleapis.com/com-roboflow-marketing/cvpr-2025-posters/34871.png\" alt=\"MASt3R-SLAM: Real-Time Dense SLAM with 3D Reconstruction Priors\" width=\"400px\" align=\"left\" /\u003e\n    \u003c/a\u003e\n    \u003ca href=\"https://arxiv.org/abs/2412.12392\" title=\"MASt3R-SLAM: Real-Time Dense SLAM with 3D Reconstruction Priors\"\u003e\n        \u003cstrong\u003e🔥 MASt3R-SLAM: Real-Time Dense SLAM with 3D Reconstruction Priors\u003c/strong\u003e\n    \u003c/a\u003e\n    \u003cbr/\u003e\n    Riku Murai, Eric Dexheimer, Andrew J. Davison\n    \u003cbr/\u003e\n    [\u003ca href=\"https://arxiv.org/abs/2412.12392\"\u003epaper\u003c/a\u003e] [\u003ca href=\"https://github.com/rmurai0610/MASt3R-SLAM\"\u003ecode\u003c/a\u003e] [\u003ca href=\"https://www.youtube.com/watch?v=wozt71NBFTQ\"\u003evideo\u003c/a\u003e]  \n    \u003cbr/\u003e\n    \u003cstrong\u003eTopic:\u003c/strong\u003e 3D Vision\n    \u003cbr/\u003e\n    \u003cstrong\u003eSession:\u003c/strong\u003e Sat 14 Jun 3 p.m. PDT — 5 p.m. PDT Poster Session 4 #83\n\u003c/p\u003e\n\u003cbr/\u003e\n\u003cbr/\u003e\n\n\n\u003cp align=\"left\"\u003e\n    \u003ca href=\"https://cvpr.thecvf.com/media/PosterPDFs/CVPR%202025/35013.png?t=1748718962.8355792\" title=\"RelationField: Relate Anything in Radiance Fields\"\u003e\n        \u003cimg src=\"https://storage.googleapis.com/com-roboflow-marketing/cvpr-2025-posters/35013.png\" alt=\"RelationField: Relate Anything in Radiance Fields\" width=\"400px\" align=\"left\" /\u003e\n    \u003c/a\u003e\n    \u003ca href=\"https://arxiv.org/abs/2412.13652\" title=\"RelationField: Relate Anything in Radiance Fields\"\u003e\n        \u003cstrong\u003eRelationField: Relate Anything in Radiance Fields\u003c/strong\u003e\n    \u003c/a\u003e\n    \u003cbr/\u003e\n    Sebastian Koch, Johanna Wald, Mirco Colosi, Narunas Vaskevicius, Pedro Hermosilla, Federico Tombari, Timo Ropinski\n    \u003cbr/\u003e\n    [\u003ca href=\"https://arxiv.org/abs/2412.13652\"\u003epaper\u003c/a\u003e] [\u003ca href=\"https://github.com/boschresearch/relationfield\"\u003ecode\u003c/a\u003e] [\u003ca href=\"https://youtu.be/8XxWzoWnYT0\"\u003evideo\u003c/a\u003e]  \n    \u003cbr/\u003e\n    \u003cstrong\u003eTopic:\u003c/strong\u003e 3D Vision\n    \u003cbr/\u003e\n    \u003cstrong\u003eSession:\u003c/strong\u003e Sun 15 Jun 8:30 a.m. PDT — 10:30 a.m. PDT Poster Session 5 #190\n\u003c/p\u003e\n\u003cbr/\u003e\n\u003cbr/\u003e\n\n### depth estimation\n\n\u003cp align=\"left\"\u003e\n    \u003ca href=\"https://cvpr.thecvf.com/media/PosterPDFs/CVPR%202025/32554.png?t=1748195633.2703488\" title=\"UniK3D: Universal Camera Monocular 3D Estimation\"\u003e\n        \u003cimg src=\"https://storage.googleapis.com/com-roboflow-marketing/cvpr-2025-posters/32554.png\" alt=\"UniK3D: Universal Camera Monocular 3D Estimation\" width=\"400px\" align=\"left\" /\u003e\n    \u003c/a\u003e\n    \u003ca href=\"https://arxiv.org/abs/2503.16591\" title=\"UniK3D: Universal Camera Monocular 3D Estimation\"\u003e\n        \u003cstrong\u003eUniK3D: Universal Camera Monocular 3D Estimation\u003c/strong\u003e\n    \u003c/a\u003e\n    \u003cbr/\u003e\n    Luigi Piccinelli, Christos Sakaridis, Mattia Segu, Yung-Hsu Yang, Siyuan Li, Wim Abbeloos, Luc Van Gool\n    \u003cbr/\u003e\n    [\u003ca href=\"https://arxiv.org/abs/2503.16591\"\u003epaper\u003c/a\u003e] [\u003ca href=\"https://github.com/lpiccinelli-eth/UniK3D\"\u003ecode\u003c/a\u003e]  [\u003ca href=\"https://huggingface.co/spaces/lpiccinelli/UniK3D-demo\"\u003edemo\u003c/a\u003e] \n    \u003cbr/\u003e\n    \u003cstrong\u003eTopic:\u003c/strong\u003e Depth Estimation\n    \u003cbr/\u003e\n    \u003cstrong\u003eSession:\u003c/strong\u003e Fri 13 Jun 8:30 a.m. PDT — 10:30 a.m. PDT Poster Session 1 #80\n\u003c/p\u003e\n\u003cbr/\u003e\n\u003cbr/\u003e\n\n\n\u003cp align=\"left\"\u003e\n    \u003ca href=\"https://cvpr.thecvf.com/media/PosterPDFs/CVPR%202025/33026.png?t=1749131392.5907311\" title=\"DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos\"\u003e\n        \u003cimg src=\"https://storage.googleapis.com/com-roboflow-marketing/cvpr-2025-posters/33026.png\" alt=\"DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos\" width=\"400px\" align=\"left\" /\u003e\n    \u003c/a\u003e\n    \u003ca href=\"https://arxiv.org/abs/2409.02095\" title=\"DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos\"\u003e\n        \u003cstrong\u003e🔥 DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos\u003c/strong\u003e\n    \u003c/a\u003e\n    \u003cbr/\u003e\n    Wenbo Hu, Xiangjun Gao, Xiaoyu Li, Sijie Zhao, Xiaodong Cun, Yong Zhang, Long Quan, Ying Shan\n    \u003cbr/\u003e\n    [\u003ca href=\"https://arxiv.org/abs/2409.02095\"\u003epaper\u003c/a\u003e] [\u003ca href=\"https://github.com/Tencent/DepthCrafter\"\u003ecode\u003c/a\u003e]  [\u003ca href=\"https://huggingface.co/spaces/tencent/DepthCrafter\"\u003edemo\u003c/a\u003e] \n    \u003cbr/\u003e\n    \u003cstrong\u003eTopic:\u003c/strong\u003e Depth Estimation\n    \u003cbr/\u003e\n    \u003cstrong\u003eSession:\u003c/strong\u003e Fri 13 Jun 8:30 a.m. PDT — 10:30 a.m. PDT Poster Session 1 #171\n\u003c/p\u003e\n\u003cbr/\u003e\n\u003cbr/\u003e\n\n\n\u003cp align=\"left\"\u003e\n    \u003ca href=\"https://cvpr.thecvf.com/media/PosterPDFs/CVPR%202025/33862.png?t=1747997885.3577623\" title=\"Video Depth Anything: Consistent Depth Estimation for Super-Long Videos\"\u003e\n        \u003cimg src=\"https://storage.googleapis.com/com-roboflow-marketing/cvpr-2025-posters/33862.png\" alt=\"Video Depth Anything: Consistent Depth Estimation for Super-Long Videos\" width=\"400px\" align=\"left\" /\u003e\n    \u003c/a\u003e\n    \u003ca href=\"https://arxiv.org/abs/2501.12375\" title=\"Video Depth Anything: Consistent Depth Estimation for Super-Long Videos\"\u003e\n        \u003cstrong\u003eVideo Depth Anything: Consistent Depth Estimation for Super-Long Videos\u003c/strong\u003e\n    \u003c/a\u003e\n    \u003cbr/\u003e\n    Sili Chen, Hengkai Guo, Shengnan Zhu, Feihu Zhang, Zilong Huang, Jiashi Feng, Bingyi Kang\n    \u003cbr/\u003e\n    [\u003ca href=\"https://arxiv.org/abs/2501.12375\"\u003epaper\u003c/a\u003e] [\u003ca href=\"https://github.com/DepthAnything/Video-Depth-Anything\"\u003ecode\u003c/a\u003e]  [\u003ca href=\"https://huggingface.co/spaces/depth-anything/Video-Depth-Anything\"\u003edemo\u003c/a\u003e] \n    \u003cbr/\u003e\n    \u003cstrong\u003eTopic:\u003c/strong\u003e Depth Estimation\n    \u003cbr/\u003e\n    \u003cstrong\u003eSession:\u003c/strong\u003e Sun 15 Jun 8:30 a.m. PDT — 10:30 a.m. PDT Poster Session 5 #169\n\u003c/p\u003e\n\u003cbr/\u003e\n\u003cbr/\u003e\n\n### explainability and interpretability\n\n\u003cp align=\"left\"\u003e\n    \u003ca href=\"https://cvpr.thecvf.com/media/PosterPDFs/CVPR%202025/34644.png?t=1748853080.0173087\" title=\"Interpreting Object-level Foundation Models via Visual Precision Search\"\u003e\n        \u003cimg src=\"https://storage.googleapis.com/com-roboflow-marketing/cvpr-2025-posters/34644.png\" alt=\"Interpreting Object-level Foundation Models via Visual Precision Search\" width=\"400px\" align=\"left\" /\u003e\n    \u003c/a\u003e\n    \u003ca href=\"https://arxiv.org/abs/2411.16198\" title=\"Interpreting Object-level Foundation Models via Visual Precision Search\"\u003e\n        \u003cstrong\u003e🔥 Interpreting Object-level Foundation Models via Visual Precision Search\u003c/strong\u003e\n    \u003c/a\u003e\n    \u003cbr/\u003e\n    Ruoyu Chen, Siyuan Liang, Jingzhi Li, Shiming Liu, Maosen Li, Zhen Huang, Hua Zhang, Xiaochun Cao\n    \u003cbr/\u003e\n    [\u003ca href=\"https://arxiv.org/abs/2411.16198\"\u003epaper\u003c/a\u003e] [\u003ca href=\"https://github.com/RuoyuChen10/VPS\"\u003ecode\u003c/a\u003e]   [\u003ca href=\"https://colab.research.google.com/github/RuoyuChen10/VPS/blob/main/tutorial/Grounding_DINO_explanation.ipynb\"\u003ecolab\u003c/a\u003e]\n    \u003cbr/\u003e\n    \u003cstrong\u003eTopic:\u003c/strong\u003e Explainability and Interpretability\n    \u003cbr/\u003e\n    \u003cstrong\u003eSession:\u003c/strong\u003e Sun 15 Jun 2 p.m. PDT — 4 p.m. PDT Poster Session 6 #372\n\u003c/p\u003e\n\u003cbr/\u003e\n\u003cbr/\u003e\n\n### gaze target estimation\n\n\u003cp align=\"left\"\u003e\n    \u003ca href=\"https://cvpr.thecvf.com/media/PosterPDFs/CVPR%202025/34852.png?t=1748847619.7422361\" title=\"Gaze-LLE: Gaze Target Estimation via Large-Scale Learned Encoders\"\u003e\n        \u003cimg src=\"https://storage.googleapis.com/com-roboflow-marketing/cvpr-2025-posters/34852.png\" alt=\"Gaze-LLE: Gaze Target Estimation via Large-Scale Learned Encoders\" width=\"400px\" align=\"left\" /\u003e\n    \u003c/a\u003e\n    \u003ca href=\"https://arxiv.org/abs/2412.09586\" title=\"Gaze-LLE: Gaze Target Estimation via Large-Scale Learned Encoders\"\u003e\n        \u003cstrong\u003e🔥 Gaze-LLE: Gaze Target Estimation via Large-Scale Learned Encoders\u003c/strong\u003e\n    \u003c/a\u003e\n    \u003cbr/\u003e\n    Fiona Ryan, Ajay Bati, Sangmin Lee, Daniel Bolya, Judy Hoffman, James M. Rehg\n    \u003cbr/\u003e\n    [\u003ca href=\"https://arxiv.org/abs/2412.09586\"\u003epaper\u003c/a\u003e] [\u003ca href=\"https://github.com/fkryan/gazelle\"\u003ecode\u003c/a\u003e]  [\u003ca href=\"https://huggingface.co/spaces/fffiloni/Gaze-LLE\"\u003edemo\u003c/a\u003e] [\u003ca href=\"https://colab.research.google.com/drive/1TSoyFvNs1-au9kjOZN_fo5ebdzngSPDq?usp=sharing\"\u003ecolab\u003c/a\u003e]\n    \u003cbr/\u003e\n    \u003cstrong\u003eTopic:\u003c/strong\u003e Gaze Target Estimation\n    \u003cbr/\u003e\n    \u003cstrong\u003eSession:\u003c/strong\u003e Sun 15 Jun 2 p.m. PDT — 4 p.m. PDT Poster Session 6 #98\n\u003c/p\u003e\n\u003cbr/\u003e\n\u003cbr/\u003e\n\n### generative models\n\n\u003cp align=\"left\"\u003e\n    \u003ca href=\"https://cvpr.thecvf.com/media/PosterPDFs/CVPR%202025/33479.png?t=1748410877.7850628\" title=\"MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis\"\u003e\n        \u003cimg src=\"https://storage.googleapis.com/com-roboflow-marketing/cvpr-2025-posters/33479.png\" alt=\"MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis\" width=\"400px\" align=\"left\" /\u003e\n    \u003c/a\u003e\n    \u003ca href=\"https://arxiv.org/abs/2412.15322\" title=\"MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis\"\u003e\n        \u003cstrong\u003eMMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis\u003c/strong\u003e\n    \u003c/a\u003e\n    \u003cbr/\u003e\n    Ho Kei Cheng, Masato Ishii, Akio Hayakawa, Takashi Shibuya, Alexander Schwing, Yuki Mitsufuji\n    \u003cbr/\u003e\n    [\u003ca href=\"https://arxiv.org/abs/2412.15322\"\u003epaper\u003c/a\u003e] [\u003ca href=\"https://github.com/hkchengrex/MMAudio\"\u003ecode\u003c/a\u003e] [\u003ca href=\"https://youtu.be/YElewUT2M4M\"\u003evideo\u003c/a\u003e] [\u003ca href=\"https://huggingface.co/spaces/hkchengrex/MMAudio\"\u003edemo\u003c/a\u003e] [\u003ca href=\"https://colab.research.google.com/drive/1TAaXCY2-kPk4xE4PwKB3EqFbSnkUuzZ8?usp=sharing\"\u003ecolab\u003c/a\u003e]\n    \u003cbr/\u003e\n    \u003cstrong\u003eTopic:\u003c/strong\u003e Generative Models\n    \u003cbr/\u003e\n    \u003cstrong\u003eSession:\u003c/strong\u003e Sun 15 Jun 2 p.m. PDT — 4 p.m. PDT Poster Session 6 #260\n\u003c/p\u003e\n\u003cbr/\u003e\n\u003cbr/\u003e\n\n\n\u003cp align=\"left\"\u003e\n    \u003ca href=\"https://cvpr.thecvf.com/media/PosterPDFs/CVPR%202025/32785.png?t=1748780647.7372541\" title=\"SemanticDraw: Towards Real-Time Interactive Content Creation from Image Diffusion Models\"\u003e\n        \u003cimg src=\"https://storage.googleapis.com/com-roboflow-marketing/cvpr-2025-posters/32785.png\" alt=\"SemanticDraw: Towards Real-Time Interactive Content Creation from Image Diffusion Models\" width=\"400px\" align=\"left\" /\u003e\n    \u003c/a\u003e\n    \u003ca href=\"https://arxiv.org/abs/2403.09055\" title=\"SemanticDraw: Towards Real-Time Interactive Content Creation from Image Diffusion Models\"\u003e\n        \u003cstrong\u003eSemanticDraw: Towards Real-Time Interactive Content Creation from Image Diffusion Models\u003c/strong\u003e\n    \u003c/a\u003e\n    \u003cbr/\u003e\n    Jaerin Lee, Daniel Sungho Jung, Kanggeon Lee, Kyoung Mu Lee\n    \u003cbr/\u003e\n    [\u003ca href=\"https://arxiv.org/abs/2403.09055\"\u003epaper\u003c/a\u003e] [\u003ca href=\"https://github.com/ironjr/semantic-draw\"\u003ecode\u003c/a\u003e] [\u003ca href=\"https://www.youtube.com/watch?v=qR06iiaG5nc\"\u003evideo\u003c/a\u003e] [\u003ca href=\"https://huggingface.co/spaces/ironjr/semantic-draw-canvas-sdxl\"\u003edemo\u003c/a\u003e] [\u003ca href=\"https://colab.research.google.com/github/camenduru/SemanticPalette-jupyter/blob/main/SemanticPalette_jupyter.ipynb\"\u003ecolab\u003c/a\u003e]\n    \u003cbr/\u003e\n    \u003cstrong\u003eTopic:\u003c/strong\u003e Generative Models\n    \u003cbr/\u003e\n    \u003cstrong\u003eSession:\u003c/strong\u003e Sat 14 Jun 8:30 a.m. PDT — 10:30 a.m. PDT Poster Session 3 #226\n\u003c/p\u003e\n\u003cbr/\u003e\n\u003cbr/\u003e\n\n### image matching\n\n\u003cp align=\"left\"\u003e\n    \u003ca href=\"https://cvpr.thecvf.com/media/PosterPDFs/CVPR%202025/34813.png?t=1748519375.4086587\" title=\"MINIMA: Modality Invariant Image Matching\"\u003e\n        \u003cimg src=\"https://storage.googleapis.com/com-roboflow-marketing/cvpr-2025-posters/34813.png\" alt=\"MINIMA: Modality Invariant Image Matching\" width=\"400px\" align=\"left\" /\u003e\n    \u003c/a\u003e\n    \u003ca href=\"https://arxiv.org/abs/2412.19412\" title=\"MINIMA: Modality Invariant Image Matching\"\u003e\n        \u003cstrong\u003eMINIMA: Modality Invariant Image Matching\u003c/strong\u003e\n    \u003c/a\u003e\n    \u003cbr/\u003e\n    Jiangwei Ren, Xingyu Jiang, Zizhuo Li, Dingkang Liang, Xin Zhou, Xiang Bai\n    \u003cbr/\u003e\n    [\u003ca href=\"https://arxiv.org/abs/2412.19412\"\u003epaper\u003c/a\u003e] [\u003ca href=\"https://github.com/LSXI7/MINIMA\"\u003ecode\u003c/a\u003e]  [\u003ca href=\"https://huggingface.co/spaces/lsxi77777/MINIMA\"\u003edemo\u003c/a\u003e] \n    \u003cbr/\u003e\n    \u003cstrong\u003eTopic:\u003c/strong\u003e Image Matching\n    \u003cbr/\u003e\n    \u003cstrong\u003eSession:\u003c/strong\u003e Sun 15 Jun 8:30 a.m. PDT — 10:30 a.m. PDT Poster Session 5 #190\n\u003c/p\u003e\n\u003cbr/\u003e\n\u003cbr/\u003e\n\n### image vectorization\n\n\u003cp align=\"left\"\u003e\n    \u003ca href=\"https://cvpr.thecvf.com/media/PosterPDFs/CVPR%202025/34467.png?t=1748720373.8849306\" title=\"Layered Image Vectorization via Semantic Simplification\"\u003e\n        \u003cimg src=\"https://storage.googleapis.com/com-roboflow-marketing/cvpr-2025-posters/34467.png\" alt=\"Layered Image Vectorization via Semantic Simplification\" width=\"400px\" align=\"left\" /\u003e\n    \u003c/a\u003e\n    \u003ca href=\"https://arxiv.org/abs/2406.05404\" title=\"Layered Image Vectorization via Semantic Simplification\"\u003e\n        \u003cstrong\u003eLayered Image Vectorization via Semantic Simplification\u003c/strong\u003e\n    \u003c/a\u003e\n    \u003cbr/\u003e\n    Zhenyu Wang, Jianxi Huang, Zhida Sun, Yuanhao Gong, Daniel Cohen-Or, Min Lu\n    \u003cbr/\u003e\n    [\u003ca href=\"https://arxiv.org/abs/2406.05404\"\u003epaper\u003c/a\u003e] [\u003ca href=\"https://github.com/SZUVIZ/layered_vectorization\"\u003ecode\u003c/a\u003e] [\u003ca href=\"https://youtu.be/oUYQKjDlwCw\"\u003evideo\u003c/a\u003e]  \n    \u003cbr/\u003e\n    \u003cstrong\u003eTopic:\u003c/strong\u003e Image Vectorization\n    \u003cbr/\u003e\n    \u003cstrong\u003eSession:\u003c/strong\u003e Fri 13 Jun 2 p.m. PDT — 4 p.m. PDT Poster Session 2 #226\n\u003c/p\u003e\n\u003cbr/\u003e\n\u003cbr/\u003e\n\n### object tracking\n\n\u003cp align=\"left\"\u003e\n    \u003ca href=\"https://cvpr.thecvf.com/media/PosterPDFs/CVPR%202025/35010.png?t=1748684123.2752578\" title=\"MITracker: Multi-View Integration for Visual Object Tracking\"\u003e\n        \u003cimg src=\"https://storage.googleapis.com/com-roboflow-marketing/cvpr-2025-posters/35010.png\" alt=\"MITracker: Multi-View Integration for Visual Object Tracking\" width=\"400px\" align=\"left\" /\u003e\n    \u003c/a\u003e\n    \u003ca href=\"https://arxiv.org/abs/2502.20111\" title=\"MITracker: Multi-View Integration for Visual Object Tracking\"\u003e\n        \u003cstrong\u003e🔥 MITracker: Multi-View Integration for Visual Object Tracking\u003c/strong\u003e\n    \u003c/a\u003e\n    \u003cbr/\u003e\n    Mengjie Xu, Yitao Zhu, Haotian Jiang, Jiaming Li, Zhenrong Shen, Sheng Wang, Haolin Huang, Xinyu Wang, Qing Yang, Han Zhang, Qian Wang\n    \u003cbr/\u003e\n    [\u003ca href=\"https://arxiv.org/abs/2502.20111\"\u003epaper\u003c/a\u003e] [\u003ca href=\"https://github.com/XuM007/MITracker\"\u003ecode\u003c/a\u003e]   \n    \u003cbr/\u003e\n    \u003cstrong\u003eTopic:\u003c/strong\u003e Object Tracking\n    \u003cbr/\u003e\n    \u003cstrong\u003eSession:\u003c/strong\u003e Sun 15 Jun 2 p.m. PDT — 4 p.m. PDT Poster Session 6 #98\n\u003c/p\u003e\n\u003cbr/\u003e\n\u003cbr/\u003e\n\n\n\u003cp align=\"left\"\u003e\n    \u003ca href=\"https://cvpr.thecvf.com/media/PosterPDFs/CVPR%202025/33882.png?t=1748536728.1331344\" title=\"Multiple Object Tracking as ID Prediction\"\u003e\n        \u003cimg src=\"https://storage.googleapis.com/com-roboflow-marketing/cvpr-2025-posters/33882.png\" alt=\"Multiple Object Tracking as ID Prediction\" width=\"400px\" align=\"left\" /\u003e\n    \u003c/a\u003e\n    \u003ca href=\"https://arxiv.org/abs/2403.16848\" title=\"Multiple Object Tracking as ID Prediction\"\u003e\n        \u003cstrong\u003eMultiple Object Tracking as ID Prediction\u003c/strong\u003e\n    \u003c/a\u003e\n    \u003cbr/\u003e\n    Ruopeng Gao, Ji Qi, Limin Wang\n    \u003cbr/\u003e\n    [\u003ca href=\"https://arxiv.org/abs/2403.16848\"\u003epaper\u003c/a\u003e] [\u003ca href=\"https://github.com/MCG-NJU/MOTIP\"\u003ecode\u003c/a\u003e]   \n    \u003cbr/\u003e\n    \u003cstrong\u003eTopic:\u003c/strong\u003e Object Tracking\n    \u003cbr/\u003e\n    \u003cstrong\u003eSession:\u003c/strong\u003e Sun 15 Jun 2 p.m. PDT — 4 p.m. PDT Poster Session 6 #163\n\u003c/p\u003e\n\u003cbr/\u003e\n\u003cbr/\u003e\n\n\n\u003cp align=\"left\"\u003e\n    \u003ca href=\"https://arxiv.org/abs/2501.07256\" title=\"EdgeTAM: On-Device Track Anything Model\"\u003e\n        \u003cstrong\u003eEdgeTAM: On-Device Track Anything Model\u003c/strong\u003e\n    \u003c/a\u003e\n    \u003cbr/\u003e\n    Chong Zhou, Chenchen Zhu, Yunyang Xiong, Saksham Suri, Fanyi Xiao, Lemeng Wu, Raghuraman Krishnamoorthi, Bo Dai, Chen Change Loy, Vikas Chandra, Bilge Soran\n    \u003cbr/\u003e\n    [\u003ca href=\"https://arxiv.org/abs/2501.07256\"\u003epaper\u003c/a\u003e] [\u003ca href=\"https://github.com/facebookresearch/EdgeTAM\"\u003ecode\u003c/a\u003e]  [\u003ca href=\"https://huggingface.co/spaces/facebook/EdgeTAM\"\u003edemo\u003c/a\u003e] \n    \u003cbr/\u003e\n    \u003cstrong\u003eTopic:\u003c/strong\u003e Object Tracking\n    \u003cbr/\u003e\n    \u003cstrong\u003eSession:\u003c/strong\u003e Sat 14 Jun 8:30 a.m. PDT — 10:30 a.m. PDT Poster Session 3 #304\n\u003c/p\u003e\n\u003cbr/\u003e\n\n\n\u003cp align=\"left\"\u003e\n    \u003ca href=\"https://cvpr.thecvf.com/media/PosterPDFs/CVPR%202025/35133.png?t=1748777099.726237\" title=\"A Distractor-Aware Memory for Visual Object Tracking with SAM2\"\u003e\n        \u003cimg src=\"https://storage.googleapis.com/com-roboflow-marketing/cvpr-2025-posters/35133.png\" alt=\"A Distractor-Aware Memory for Visual Object Tracking with SAM2\" width=\"400px\" align=\"left\" /\u003e\n    \u003c/a\u003e\n    \u003ca href=\"https://arxiv.org/abs/2411.17576\" title=\"A Distractor-Aware Memory for Visual Object Tracking with SAM2\"\u003e\n        \u003cstrong\u003eA Distractor-Aware Memory for Visual Object Tracking with SAM2\u003c/strong\u003e\n    \u003c/a\u003e\n    \u003cbr/\u003e\n    Jovana Videnovic, Alan Lukezic, Matej Kristan\n    \u003cbr/\u003e\n    [\u003ca href=\"https://arxiv.org/abs/2411.17576\"\u003epaper\u003c/a\u003e] [\u003ca href=\"https://github.com/jovanavidenovic/DAM4SAM\"\u003ecode\u003c/a\u003e]   \n    \u003cbr/\u003e\n    \u003cstrong\u003eTopic:\u003c/strong\u003e Object Tracking\n    \u003cbr/\u003e\n    \u003cstrong\u003eSession:\u003c/strong\u003e Sun 15 Jun 8:30 a.m. PDT — 10:30 a.m. PDT Poster Session 5 #309\n\u003c/p\u003e\n\u003cbr/\u003e\n\u003cbr/\u003e\n\n\n\u003cp align=\"left\"\u003e\n    \u003ca href=\"https://cvpr.thecvf.com/media/PosterPDFs/CVPR%202025/32888.png?t=1747453263.5318122\" title=\"From Poses to Identity: Training-Free Person Re-Identification via Feature Centralization\"\u003e\n        \u003cimg src=\"https://storage.googleapis.com/com-roboflow-marketing/cvpr-2025-posters/32888.png\" alt=\"From Poses to Identity: Training-Free Person Re-Identification via Feature Centralization\" width=\"400px\" align=\"left\" /\u003e\n    \u003c/a\u003e\n    \u003ca href=\"https://arxiv.org/abs/2503.00938\" title=\"From Poses to Identity: Training-Free Person Re-Identification via Feature Centralization\"\u003e\n        \u003cstrong\u003eFrom Poses to Identity: Training-Free Person Re-Identification via Feature Centralization\u003c/strong\u003e\n    \u003c/a\u003e\n    \u003cbr/\u003e\n    Chao Yuan, Guiwei Zhang, Changxiao Ma, Tianyi Zhang, Guanglin Niu\n    \u003cbr/\u003e\n    [\u003ca href=\"https://arxiv.org/abs/2503.00938\"\u003epaper\u003c/a\u003e] [\u003ca href=\"https://github.com/yuanc3/Pose2ID\"\u003ecode\u003c/a\u003e]   \n    \u003cbr/\u003e\n    \u003cstrong\u003eTopic:\u003c/strong\u003e Object Tracking\n    \u003cbr/\u003e\n    \u003cstrong\u003eSession:\u003c/strong\u003e Sun 15 Jun 8:30 a.m. PDT — 10:30 a.m. PDT Poster Session 5 #190\n\u003c/p\u003e\n\u003cbr/\u003e\n\u003cbr/\u003e\n\n### open-world detection\n\n\u003cp align=\"left\"\u003e\n    \u003ca href=\"https://cvpr.thecvf.com/media/PosterPDFs/CVPR%202025/35020.png?t=1748563484.5053573\" title=\"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models\"\u003e\n        \u003cimg src=\"https://storage.googleapis.com/com-roboflow-marketing/cvpr-2025-posters/35020.png\" alt=\"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models\" width=\"400px\" align=\"left\" /\u003e\n    \u003c/a\u003e\n    \u003ca href=\"https://arxiv.org/abs/2502.07601\" title=\"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models\"\u003e\n        \u003cstrong\u003e🔥 Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models\u003c/strong\u003e\n    \u003c/a\u003e\n    \u003cbr/\u003e\n    Jiacong Xu, Shao-Yuan Lo, Bardia Safaei, Vishal M. Patel, Isht Dwivedi\n    \u003cbr/\u003e\n    [\u003ca href=\"https://arxiv.org/abs/2502.07601\"\u003epaper\u003c/a\u003e] [\u003ca href=\"https://github.com/honda-research-institute/Anomaly-OneVision\"\u003ecode\u003c/a\u003e] [\u003ca href=\"https://www.youtube.com/watch?v=b3-qGTm23eA\"\u003evideo\u003c/a\u003e]  \n    \u003cbr/\u003e\n    \u003cstrong\u003eTopic:\u003c/strong\u003e Open-World Detection\n    \u003cbr/\u003e\n    \u003cstrong\u003eSession:\u003c/strong\u003e Sat 14 Jun 3 p.m. PDT — 5 p.m. PDT Poster Session 4 #435\n\u003c/p\u003e\n\u003cbr/\u003e\n\u003cbr/\u003e\n\n\n\u003cp align=\"left\"\u003e\n    \u003ca href=\"https://cvpr.thecvf.com/media/PosterPDFs/CVPR%202025/32802.png?t=1748865568.2500262\" title=\"Compositional Caching for Training-free Open-vocabulary Attribute Detection\"\u003e\n        \u003cimg src=\"https://storage.googleapis.com/com-roboflow-marketing/cvpr-2025-posters/32802.png\" alt=\"Compositional Caching for Training-free Open-vocabulary Attribute Detection\" width=\"400px\" align=\"left\" /\u003e\n    \u003c/a\u003e\n    \u003ca href=\"https://arxiv.org/abs/2503.19145\" title=\"Compositional Caching for Training-free Open-vocabulary Attribute Detection\"\u003e\n        \u003cstrong\u003e🔥 Compositional Caching for Training-free Open-vocabulary Attribute Detection\u003c/strong\u003e\n    \u003c/a\u003e\n    \u003cbr/\u003e\n    Marco Garosi, Alessandro Conti, Gaowen Liu, Elisa Ricci, Massimiliano Mancini\n    \u003cbr/\u003e\n    [\u003ca href=\"https://arxiv.org/abs/2503.19145\"\u003epaper\u003c/a\u003e] [\u003ca href=\"https://github.com/marco-garosi/ComCa\"\u003ecode\u003c/a\u003e] [\u003ca href=\"https://youtu.be/ruHSAGemMa8\"\u003evideo\u003c/a\u003e]  \n    \u003cbr/\u003e\n    \u003cstrong\u003eTopic:\u003c/strong\u003e Open-World Detection\n    \u003cbr/\u003e\n    \u003cstrong\u003eSession:\u003c/strong\u003e Sat 14 Jun 8:30 a.m. PDT — 10:30 a.m. PDT Poster Session 3 #426\n\u003c/p\u003e\n\u003cbr/\u003e\n\u003cbr/\u003e\n\n### pose estimation\n\n\u003cp align=\"left\"\u003e\n    \u003ca href=\"https://cvpr.thecvf.com/media/PosterPDFs/CVPR%202025/35057.png?t=1748706748.0220559\" title=\"Reconstructing Humans with a Biomechanically Accurate Skeleton\"\u003e\n        \u003cimg src=\"https://storage.googleapis.com/com-roboflow-marketing/cvpr-2025-posters/35057.png\" alt=\"Reconstructing Humans with a Biomechanically Accurate Skeleton\" width=\"400px\" align=\"left\" /\u003e\n    \u003c/a\u003e\n    \u003ca href=\"https://arxiv.org/abs/2503.21751\" title=\"Reconstructing Humans with a Biomechanically Accurate Skeleton\"\u003e\n        \u003cstrong\u003e🔥 Reconstructing Humans with a Biomechanically Accurate Skeleton\u003c/strong\u003e\n    \u003c/a\u003e\n    \u003cbr/\u003e\n    Yan Xia, Xiaowei Zhou, Etienne Vouga, Qixing Huang, Georgios Pavlakos\n    \u003cbr/\u003e\n    [\u003ca href=\"https://arxiv.org/abs/2503.21751\"\u003epaper\u003c/a\u003e] [\u003ca href=\"https://github.com/IsshikiHugh/HSMR\"\u003ecode\u003c/a\u003e]  [\u003ca href=\"https://huggingface.co/spaces/IsshikiHugh/HSMR\"\u003edemo\u003c/a\u003e] [\u003ca href=\"https://colab.research.google.com/drive/1RDA9iKckCDKh_bbaKjO8bQ0-Lv5fw1CB?usp=sharing\"\u003ecolab\u003c/a\u003e]\n    \u003cbr/\u003e\n    \u003cstrong\u003eTopic:\u003c/strong\u003e Pose Estimation\n    \u003cbr/\u003e\n    \u003cstrong\u003eSession:\u003c/strong\u003e Fri 13 Jun 2 p.m. PDT — 4 p.m. PDT Poster Session 2 #91\n\u003c/p\u003e\n\u003cbr/\u003e\n\u003cbr/\u003e\n\n### segmentation\n\n\u003cp align=\"left\"\u003e\n    \u003ca href=\"https://storage.googleapis.com/com-roboflow-marketing/cvpr-2025-posters/IMG_4803.JPG\" title=\"MatAnyone: Stable Video Matting with Consistent Memory Propagation\"\u003e\n        \u003cimg src=\"https://storage.googleapis.com/com-roboflow-marketing/cvpr-2025-posters/IMG_4803.JPG\" alt=\"MatAnyone: Stable Video Matting with Consistent Memory Propagation\" width=\"400px\" align=\"left\" /\u003e\n    \u003c/a\u003e\n    \u003ca href=\"https://arxiv.org/abs/2501.14677\" title=\"MatAnyone: Stable Video Matting with Consistent Memory Propagation\"\u003e\n        \u003cstrong\u003eMatAnyone: Stable Video Matting with Consistent Memory Propagation\u003c/strong\u003e\n    \u003c/a\u003e\n    \u003cbr/\u003e\n    Peiqing Yang, Shangchen Zhou, Jixin Zhao, Qingyi Tao, Chen Change Loy\n    \u003cbr/\u003e\n    [\u003ca href=\"https://arxiv.org/abs/2501.14677\"\u003epaper\u003c/a\u003e] [\u003ca href=\"https://github.com/pq-yang/MatAnyone\"\u003ecode\u003c/a\u003e] [\u003ca href=\"https://www.youtube.com/watch?v=oih0Zk-UW18\"\u003evideo\u003c/a\u003e] [\u003ca href=\"https://huggingface.co/spaces/PeiqingYang/MatAnyone\"\u003edemo\u003c/a\u003e] \n    \u003cbr/\u003e\n    \u003cstrong\u003eTopic:\u003c/strong\u003e Segmentation\n    \u003cbr/\u003e\n    \u003cstrong\u003eSession:\u003c/strong\u003e Fri 13 Jun 2 p.m. PDT — 4 p.m. PDT Poster Session 2 #185\n\u003c/p\u003e\n\u003cbr/\u003e\n\u003cbr/\u003e\n\n### stereo matching\n\n\u003cp align=\"left\"\u003e\n    \u003ca href=\"https://cvpr.thecvf.com/media/PosterPDFs/CVPR%202025/34330.png?t=1748714664.9139624\" title=\"FoundationStereo: Zero-Shot Stereo Matching\"\u003e\n        \u003cimg src=\"https://storage.googleapis.com/com-roboflow-marketing/cvpr-2025-posters/34330.png\" alt=\"FoundationStereo: Zero-Shot Stereo Matching\" width=\"400px\" align=\"left\" /\u003e\n    \u003c/a\u003e\n    \u003ca href=\"https://arxiv.org/abs/2501.09898\" title=\"FoundationStereo: Zero-Shot Stereo Matching\"\u003e\n        \u003cstrong\u003e🔥 FoundationStereo: Zero-Shot Stereo Matching\u003c/strong\u003e\n    \u003c/a\u003e\n    \u003cbr/\u003e\n    Bowen Wen, Matthew Trepte, Joseph Aribido, Jan Kautz, Orazio Gallo, Stan Birchfield\n    \u003cbr/\u003e\n    [\u003ca href=\"https://arxiv.org/abs/2501.09898\"\u003epaper\u003c/a\u003e] [\u003ca href=\"https://github.com/NVlabs/FoundationStereo\"\u003ecode\u003c/a\u003e] [\u003ca href=\"https://www.youtube.com/watch?v=R7RgHxEXB3o\"\u003evideo\u003c/a\u003e]  \n    \u003cbr/\u003e\n    \u003cstrong\u003eTopic:\u003c/strong\u003e Stereo Matching\n    \u003cbr/\u003e\n    \u003cstrong\u003eSession:\u003c/strong\u003e Fri 13 Jun 2 p.m. PDT — 4 p.m. PDT Poster Session 2 #81\n\u003c/p\u003e\n\u003cbr/\u003e\n\u003cbr/\u003e\n\n### video understanding\n\n\u003cp align=\"left\"\u003e\n    \u003ca href=\"https://cvpr.thecvf.com/media/PosterPDFs/CVPR%202025/32544.png?t=1748596202.019788\" title=\"Towards Universal Soccer Video Understanding\"\u003e\n        \u003cimg src=\"https://storage.googleapis.com/com-roboflow-marketing/cvpr-2025-posters/32544.png\" alt=\"Towards Universal Soccer Video Understanding\" width=\"400px\" align=\"left\" /\u003e\n    \u003c/a\u003e\n    \u003ca href=\"https://arxiv.org/abs/2412.01820\" title=\"Towards Universal Soccer Video Understanding\"\u003e\n        \u003cstrong\u003eTowards Universal Soccer Video Understanding\u003c/strong\u003e\n    \u003c/a\u003e\n    \u003cbr/\u003e\n    Jiayuan Rao, Haoning Wu, Hao Jiang, Ya Zhang, Yanfeng Wang, Weidi Xie\n    \u003cbr/\u003e\n    [\u003ca href=\"https://arxiv.org/abs/2412.01820\"\u003epaper\u003c/a\u003e] [\u003ca href=\"https://github.com/jyrao/UniSoccer\"\u003ecode\u003c/a\u003e]   \n    \u003cbr/\u003e\n    \u003cstrong\u003eTopic:\u003c/strong\u003e Video Understanding\n    \u003cbr/\u003e\n    \u003cstrong\u003eSession:\u003c/strong\u003e Fri 13 Jun 2 p.m. PDT — 4 p.m. PDT Poster Session 2 #185\n\u003c/p\u003e\n\u003cbr/\u003e\n\u003cbr/\u003e\n\n### vision-language models\n\n\u003cp align=\"left\"\u003e\n    \u003ca href=\"https://cvpr.thecvf.com/media/PosterPDFs/CVPR%202025/32887.png?t=1747896029.4399107\" title=\"FastVLM: Efficient Vision Encoding for Vision Language Models\"\u003e\n        \u003cimg src=\"https://storage.googleapis.com/com-roboflow-marketing/cvpr-2025-posters/32887.png\" alt=\"FastVLM: Efficient Vision Encoding for Vision Language Models\" width=\"400px\" align=\"left\" /\u003e\n    \u003c/a\u003e\n    \u003ca href=\"https://arxiv.org/abs/2412.13303\" title=\"FastVLM: Efficient Vision Encoding for Vision Language Models\"\u003e\n        \u003cstrong\u003eFastVLM: Efficient Vision Encoding for Vision Language Models\u003c/strong\u003e\n    \u003c/a\u003e\n    \u003cbr/\u003e\n    Pavan Kumar Anasosalu Vasu, Fartash Faghri, Chun-Liang Li, Cem Koc, Nate True, Albert Antony, Gokul Santhanam, James Gabriel, Peter Grasch, Oncel Tuzel, Hadi Pouransari\n    \u003cbr/\u003e\n    [\u003ca href=\"https://arxiv.org/abs/2412.13303\"\u003epaper\u003c/a\u003e] [\u003ca href=\"https://github.com/apple/ml-fastvlm\"\u003ecode\u003c/a\u003e]   \n    \u003cbr/\u003e\n    \u003cstrong\u003eTopic:\u003c/strong\u003e Vision-Language Models\n    \u003cbr/\u003e\n    \u003cstrong\u003eSession:\u003c/strong\u003e Sat 14 Jun 3 p.m. PDT — 5 p.m. PDT Poster Session 4 #378\n\u003c/p\u003e\n\u003cbr/\u003e\n\u003cbr/\u003e\n\n\n\u003cp align=\"left\"\u003e\n    \u003ca href=\"https://cvpr.thecvf.com/media/PosterPDFs/CVPR%202025/33073.png?t=1748883064.876014\" title=\"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models\"\u003e\n        \u003cimg src=\"https://storage.googleapis.com/com-roboflow-marketing/cvpr-2025-posters/33073.png\" alt=\"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models\" width=\"400px\" align=\"left\" /\u003e\n    \u003c/a\u003e\n    \u003ca href=\"https://arxiv.org/abs/2409.17146\" title=\"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models\"\u003e\n        \u003cstrong\u003e🔥 Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models\u003c/strong\u003e\n    \u003c/a\u003e\n    \u003cbr/\u003e\n    Matt Deitke, Christopher Clark, Sangho Lee, Rohun Tripathi, Yue Yang, Jae Sung Park, Mohammadreza Salehi, Niklas Muennighoff, Kyle Lo, Luca Soldaini, Jiasen Lu, Taira Anderson, Erin Bransom, Kiana Ehsani, Huong Ngo, YenSung Chen, Ajay Patel, Mark Yatskar, Chris Callison-Burch, Andrew Head, Rose Hendrix, Favyen Bastani, Eli VanderBilt, Nathan Lambert, Yvonne Chou, Arnavi Chheda, Jenna Sparks, Sam Skjonsberg, Michael Schmitz, Aaron Sarnat, Byron Bischoff, Pete Walsh, Chris Newell, Piper Wolters, Tanmay Gupta, Kuo-Hao Zeng, Jon Borchardt, Dirk Groeneveld, Crystal Nam, Sophie Lebrecht, Caitlin Wittlif, Carissa Schoenick, Oscar Michel, Ranjay Krishna, Luca Weihs, Noah A. Smith, Hannaneh Hajishirzi, Ross Girshick, Ali Farhadi, Aniruddha Kembhavi\n    \u003cbr/\u003e\n    [\u003ca href=\"https://arxiv.org/abs/2409.17146\"\u003epaper\u003c/a\u003e]   [\u003ca href=\"https://huggingface.co/spaces/akhaliq/Molmo-7B-D-0924\"\u003edemo\u003c/a\u003e] \n    \u003cbr/\u003e\n    \u003cstrong\u003eTopic:\u003c/strong\u003e Vision-Language Models\n    \u003cbr/\u003e\n    \u003cstrong\u003eSession:\u003c/strong\u003e Fri 13 Jun 8:30 a.m. PDT — 10:30 a.m. PDT Poster Session 1 #80\n\u003c/p\u003e\n\u003cbr/\u003e\n\u003cbr/\u003e\n\n\n\u003cp align=\"left\"\u003e\n    \u003ca href=\"https://cvpr.thecvf.com/media/PosterPDFs/CVPR%202025/34510.png?t=1748805761.17\" title=\"SAMWISE: Infusing Wisdom in SAM2 for Text-Driven Video Segmentation\"\u003e\n        \u003cimg src=\"https://storage.googleapis.com/com-roboflow-marketing/cvpr-2025-posters/34510.png\" alt=\"SAMWISE: Infusing Wisdom in SAM2 for Text-Driven Video Segmentation\" width=\"400px\" align=\"left\" /\u003e\n    \u003c/a\u003e\n    \u003ca href=\"https://arxiv.org/abs/2411.17646\" title=\"SAMWISE: Infusing Wisdom in SAM2 for Text-Driven Video Segmentation\"\u003e\n        \u003cstrong\u003e🔥 SAMWISE: Infusing Wisdom in SAM2 for Text-Driven Video Segmentation\u003c/strong\u003e\n    \u003c/a\u003e\n    \u003cbr/\u003e\n    Claudia Cuttano, Gabriele Trivigno, Gabriele Rosi, Carlo Masone, Giuseppe Averta\n    \u003cbr/\u003e\n    [\u003ca href=\"https://arxiv.org/abs/2411.17646\"\u003epaper\u003c/a\u003e] [\u003ca href=\"https://github.com/ClaudiaCuttano/SAMWISE\"\u003ecode\u003c/a\u003e] [\u003ca href=\"https://youtu.be/OL3xvzFyXCc\"\u003evideo\u003c/a\u003e]  \n    \u003cbr/\u003e\n    \u003cstrong\u003eTopic:\u003c/strong\u003e Vision-Language Models\n    \u003cbr/\u003e\n    \u003cstrong\u003eSession:\u003c/strong\u003e Fri 13 Jun 8:30 a.m. PDT — 10:30 a.m. PDT Poster Session 1 #308\n\u003c/p\u003e\n\u003cbr/\u003e\n\u003cbr/\u003e\n\n\n\u003cp align=\"left\"\u003e\n    \u003ca href=\"https://cvpr.thecvf.com/media/PosterPDFs/CVPR%202025/34048.png?t=1748839405.5943303\" title=\"VisionArena: 230K Real World User-VLM Conversations with Preference Labels\"\u003e\n        \u003cimg src=\"https://storage.googleapis.com/com-roboflow-marketing/cvpr-2025-posters/34048.png\" alt=\"VisionArena: 230K Real World User-VLM Conversations with Preference Labels\" width=\"400px\" align=\"left\" /\u003e\n    \u003c/a\u003e\n    \u003ca href=\"https://arxiv.org/abs/2412.08687\" title=\"VisionArena: 230K Real World User-VLM Conversations with Preference Labels\"\u003e\n        \u003cstrong\u003eVisionArena: 230K Real World User-VLM Conversations with Preference Labels\u003c/strong\u003e\n    \u003c/a\u003e\n    \u003cbr/\u003e\n    Christopher Chou, Lisa Dunlap, Koki Mashita, Krishna Mandal, Trevor Darrell, Ion Stoica, Joseph E. Gonzalez, Wei-Lin Chiang\n    \u003cbr/\u003e\n    [\u003ca href=\"https://arxiv.org/abs/2412.08687\"\u003epaper\u003c/a\u003e]   [\u003ca href=\"https://huggingface.co/datasets/lmarena-ai/VisionArena-Battle\"\u003edemo\u003c/a\u003e] \n    \u003cbr/\u003e\n    \u003cstrong\u003eTopic:\u003c/strong\u003e Vision-Language Models\n    \u003cbr/\u003e\n    \u003cstrong\u003eSession:\u003c/strong\u003e Fri 13 Jun 8:30 a.m. PDT — 10:30 a.m. PDT Poster Session 1 #353\n\u003c/p\u003e\n\u003cbr/\u003e\n\u003cbr/\u003e\n\n\n\u003cp align=\"left\"\u003e\n    \u003ca href=\"https://cvpr.thecvf.com/media/PosterPDFs/CVPR%202025/33482.png?t=1748620034.1782746\" title=\"DINOv2 Meets Text: A Unified Framework for Image- and Pixel-Level Vision-Language Alignment\"\u003e\n        \u003cimg src=\"https://storage.googleapis.com/com-roboflow-marketing/cvpr-2025-posters/33482.png\" alt=\"DINOv2 Meets Text: A Unified Framework for Image- and Pixel-Level Vision-Language Alignment\" width=\"400px\" align=\"left\" /\u003e\n    \u003c/a\u003e\n    \u003ca href=\"https://arxiv.org/abs/2412.16334\" title=\"DINOv2 Meets Text: A Unified Framework for Image- and Pixel-Level Vision-Language Alignment\"\u003e\n        \u003cstrong\u003eDINOv2 Meets Text: A Unified Framework for Image- and Pixel-Level Vision-Language Alignment\u003c/strong\u003e\n    \u003c/a\u003e\n    \u003cbr/\u003e\n    Cijo Jose, Théo Moutakanni, Dahyun Kang, Federico Baldassarre, Timothée Darcet, Hu Xu, Daniel Li, Marc Szafraniec, Michaël Ramamonjisoa, Maxime Oquab, Oriane Siméoni, Huy V. Vo, Patrick Labatut, Piotr Bojanowski\n    \u003cbr/\u003e\n    [\u003ca href=\"https://arxiv.org/abs/2412.16334\"\u003epaper\u003c/a\u003e] [\u003ca href=\"https://github.com/facebookresearch/dinov2\"\u003ecode\u003c/a\u003e] [\u003ca href=\"https://youtu.be/qNsAgsvhbw4\"\u003evideo\u003c/a\u003e]  [\u003ca href=\"https://colab.research.google.com/github/facebookresearch/dinov2/blob/main/notebooks/dinotxt.ipynb\"\u003ecolab\u003c/a\u003e]\n    \u003cbr/\u003e\n    \u003cstrong\u003eTopic:\u003c/strong\u003e Vision-Language Models\n    \u003cbr/\u003e\n    \u003cstrong\u003eSession:\u003c/strong\u003e Sun 15 Jun 8:30 a.m. PDT — 10:30 a.m. PDT Poster Session 5 #169\n\u003c/p\u003e\n\u003cbr/\u003e\n\u003cbr/\u003e\n\n### visual agents\n\n\u003cp align=\"left\"\u003e\n    \u003ca href=\"https://storage.googleapis.com/com-roboflow-marketing/cvpr-2025-posters/IMG_4847_.JPG\" title=\"Magma: A Foundation Model for Multimodal AI Agents\"\u003e\n        \u003cimg src=\"https://storage.googleapis.com/com-roboflow-marketing/cvpr-2025-posters/IMG_4847_.JPG\" alt=\"Magma: A Foundation Model for Multimodal AI Agents\" width=\"400px\" align=\"left\" /\u003e\n    \u003c/a\u003e\n    \u003ca href=\"https://arxiv.org/abs/2502.13130\" title=\"Magma: A Foundation Model for Multimodal AI Agents\"\u003e\n        \u003cstrong\u003eMagma: A Foundation Model for Multimodal AI Agents\u003c/strong\u003e\n    \u003c/a\u003e\n    \u003cbr/\u003e\n    Jianwei Yang, Reuben Tan, Qianhui Wu, Ruijie Zheng, Baolin Peng, Yongyuan Liang, Yu Gu, Mu Cai, Seonghyeon Ye, Joel Jang, Yuquan Deng, Lars Liden, Jianfeng Gao\n    \u003cbr/\u003e\n    [\u003ca href=\"https://arxiv.org/abs/2502.13130\"\u003epaper\u003c/a\u003e] [\u003ca href=\"https://github.com/microsoft/Magma\"\u003ecode\u003c/a\u003e] [\u003ca href=\"https://www.youtube.com/watch?v=SbfzvUU5yM8\"\u003evideo\u003c/a\u003e] [\u003ca href=\"https://huggingface.co/spaces/microsoft/Magma-UI\"\u003edemo\u003c/a\u003e] \n    \u003cbr/\u003e\n    \u003cstrong\u003eTopic:\u003c/strong\u003e Visual Agents\n    \u003cbr/\u003e\n    \u003cstrong\u003eSession:\u003c/strong\u003e Sat 14 Jun 8:30 a.m. PDT — 10:30 a.m. PDT Poster Session 3 #340\n\u003c/p\u003e\n\u003cbr/\u003e\n\u003cbr/\u003e\n\n\n\u003cp align=\"left\"\u003e\n    \u003ca href=\"https://cvpr.thecvf.com/media/PosterPDFs/CVPR%202025/33472.png?t=1748798588.1133444\" title=\"ShowUI: One Vision-Language-Action Model for GUI Visual Agent\"\u003e\n        \u003cimg src=\"https://storage.googleapis.com/com-roboflow-marketing/cvpr-2025-posters/33472.png\" alt=\"ShowUI: One Vision-Language-Action Model for GUI Visual Agent\" width=\"400px\" align=\"left\" /\u003e\n    \u003c/a\u003e\n    \u003ca href=\"https://arxiv.org/abs/2411.17465\" title=\"ShowUI: One Vision-Language-Action Model for GUI Visual Agent\"\u003e\n        \u003cstrong\u003eShowUI: One Vision-Language-Action Model for GUI Visual Agent\u003c/strong\u003e\n    \u003c/a\u003e\n    \u003cbr/\u003e\n    Kevin Qinghong Lin, Linjie Li, Difei Gao, Zhengyuan Yang, Shiwei Wu, Zechen Bai, Weixian Lei, Lijuan Wang, Mike Zheng Shou\n    \u003cbr/\u003e\n    [\u003ca href=\"https://arxiv.org/abs/2411.17465\"\u003epaper\u003c/a\u003e] [\u003ca href=\"https://github.com/showlab/ShowUI\"\u003ecode\u003c/a\u003e]  [\u003ca href=\"https://huggingface.co/spaces/showlab/ShowUI\"\u003edemo\u003c/a\u003e] \n    \u003cbr/\u003e\n    \u003cstrong\u003eTopic:\u003c/strong\u003e Visual Agents\n    \u003cbr/\u003e\n    \u003cstrong\u003eSession:\u003c/strong\u003e Sat 14 Jun 3 p.m. PDT — 5 p.m. PDT Poster Session 4 #352\n\u003c/p\u003e\n\u003cbr/\u003e\n\u003cbr/\u003e\n\n\n\u003cp align=\"left\"\u003e\n    \u003ca href=\"https://cvpr.thecvf.com/media/PosterPDFs/CVPR%202025/32818.png?t=1748727014.6249733\" title=\"Visual Agentic AI for Spatial Reasoning with a Dynamic API\"\u003e\n        \u003cimg src=\"https://storage.googleapis.com/com-roboflow-marketing/cvpr-2025-posters/32818.png\" alt=\"Visual Agentic AI for Spatial Reasoning with a Dynamic API\" width=\"400px\" align=\"left\" /\u003e\n    \u003c/a\u003e\n    \u003ca href=\"https://arxiv.org/abs/2502.06787\" title=\"Visual Agentic AI for Spatial Reasoning with a Dynamic API\"\u003e\n        \u003cstrong\u003eVisual Agentic AI for Spatial Reasoning with a Dynamic API\u003c/strong\u003e\n    \u003c/a\u003e\n    \u003cbr/\u003e\n    Damiano Marsili, Rohun Agrawal, Yisong Yue, Georgia Gkioxari\n    \u003cbr/\u003e\n    [\u003ca href=\"https://arxiv.org/abs/2502.06787\"\u003epaper\u003c/a\u003e] [\u003ca href=\"https://github.com/damianomarsili/VADAR\"\u003ecode\u003c/a\u003e] [\u003ca href=\"https://youtu.be/zYFlDu_zsEs\"\u003evideo\u003c/a\u003e]  \n    \u003cbr/\u003e\n    \u003cstrong\u003eTopic:\u003c/strong\u003e Visual Agents\n    \u003cbr/\u003e\n    \u003cstrong\u003eSession:\u003c/strong\u003e Sat 14 Jun 3 p.m. PDT — 5 p.m. PDT Poster Session 4 #352\n\u003c/p\u003e\n\u003cbr/\u003e\n\u003cbr/\u003e\n\n\u003c!--- AUTOGENERATED_PAPERS_LIST --\u003e\n\n## 🦸 contribution\n\nWe would love your help in making this repository even better! If you know of an amazing\npaper that isn't listed here, or if you have any suggestions for improvement, feel free\nto open an\n[issue](https://github.com/SkalskiP/top-cvpr-2025-papers/issues)\nor submit a\n[pull request](https://github.com/SkalskiP/top-cvpr-2025-papers/pulls).\n","project_url":"https://awesome.ecosyste.ms/api/v1/projects/github.com%2Fskalskip%2Ftop-cvpr-2025-papers","html_url":"https://awesome.ecosyste.ms/projects/github.com%2Fskalskip%2Ftop-cvpr-2025-papers","lists_url":"https://awesome.ecosyste.ms/api/v1/projects/github.com%2Fskalskip%2Ftop-cvpr-2025-papers/lists"}