{"id":18524978,"url":"https://github.com/paddlepaddle/paddlemix","last_synced_at":"2025-04-04T18:05:05.825Z","repository":{"id":180132320,"uuid":"662392605","full_name":"PaddlePaddle/PaddleMIX","owner":"PaddlePaddle","description":"Paddle Multimodal Integration and eXploration, supporting mainstream multi-modal tasks, including end-to-end large-scale multi-modal pretrain models and diffusion model toolbox. Equipped with high performance and flexibility.","archived":false,"fork":false,"pushed_at":"2024-04-22T12:30:06.000Z","size":74969,"stargazers_count":211,"open_issues_count":59,"forks_count":89,"subscribers_count":21,"default_branch":"develop","last_synced_at":"2024-04-22T13:47:30.598Z","etag":null,"topics":["aigc","blip2","clip","controlnet","dit","eva-clip","image-to-text","llava","minigpt4","multimodal","ppdiffusers","qwen-vl","sd-xl","sora","stable-diffusion","stablevideodiffusion","text-to-image","text-to-video"],"latest_commit_sha":null,"homepage":"","language":"Python","has_issues":true,"has_wiki":null,"has_pages":null,"mirror_url":null,"source_name":null,"license":"apache-2.0","status":null,"scm":"git","pull_requests_enabled":true,"icon_url":"https://github.com/PaddlePaddle.png","metadata":{"files":{"readme":"README.md","changelog":null,"contributing":null,"funding":null,"license":"LICENSE","code_of_conduct":null,"threat_model":null,"audit":null,"citation":null,"codeowners":null,"security":null,"support":null,"governance":null,"roadmap":null,"authors":null,"dei":null}},"created_at":"2023-07-05T03:30:12.000Z","updated_at":"2024-04-22T13:47:32.392Z","dependencies_parsed_at":null,"dependency_job_id":"40f81103-6a4c-4a85-be15-a4153d6e97b2","html_url":"https://github.com/PaddlePaddle/PaddleMIX","commit_stats":null,"previous_names":["paddlepaddle/paddlemix"],"tags_count":0,"template":false,"template_full_name":null,"repository_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/PaddlePaddle%2FPaddleMIX","tags_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/PaddlePaddle%2FPaddleMIX/tags","releases_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/PaddlePaddle%2FPaddleMIX/releases","manifests_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/PaddlePaddle%2FPaddleMIX/manifests","owner_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/owners/PaddlePaddle","download_url":"https://codeload.github.com/PaddlePaddle/PaddleMIX/tar.gz/refs/heads/develop","host":{"name":"GitHub","url":"https://github.com","kind":"github","repositories_count":247226213,"owners_count":20904465,"icon_url":"https://github.com/github.png","version":null,"created_at":"2022-05-30T11:31:42.601Z","updated_at":"2022-07-04T15:15:14.044Z","host_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub","repositories_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories","repository_names_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repository_names","owners_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/owners"}},"keywords":["aigc","blip2","clip","controlnet","dit","eva-clip","image-to-text","llava","minigpt4","multimodal","ppdiffusers","qwen-vl","sd-xl","sora","stable-diffusion","stablevideodiffusion","text-to-image","text-to-video"],"created_at":"2024-11-06T17:44:04.852Z","updated_at":"2025-04-04T18:05:00.816Z","avatar_url":"https://github.com/PaddlePaddle.png","language":"Python","funding_links":[],"categories":[],"sub_categories":[],"readme":"简体中文 | [English](README_EN.md)\n\n\u003cp align=\"center\"\u003e\n  \u003cimg src=\"https://github.com/PaddlePaddle/PaddleMIX/assets/22989727/2cd19298-1c52-4d73-a0f7-dcdab6a8ec90\" align=\"middle\" width = \"600\" /\u003e\n\u003c/p\u003e\n\n\u003cp align=\"center\"\u003e\n    \u003ca href=\"https://github.com/PaddlePaddle/PaddleMix/releases\"\u003e\u003cimg src=\"https://img.shields.io/github/v/release/PaddlePaddle/PaddleMix?color=ffa\"\u003e\u003c/a\u003e\n    \u003ca href=\"./LICENSE\"\u003e\u003cimg src=\"https://img.shields.io/badge/license-Apache%202-dfd.svg\"\u003e\u003c/a\u003e\n    \u003ca href=\"\"\u003e\u003cimg src=\"https://img.shields.io/badge/python-3.7+-aff.svg\"\u003e\u003c/a\u003e\n    \u003ca href=\"\"\u003e\u003cimg src=\"https://img.shields.io/badge/os-linux%2C%20win%2C%20mac-pink.svg\"\u003e\u003c/a\u003e\n    \u003ca href=\"#📌社区交流\"\u003e\u003cimg src=\"https://img.shields.io/badge/微信-小助手加群-green?logo=wechat\u0026amp\"\u003e\u003c/a\u003e\n    \u003ca href=\"https://github.com/PaddlePaddle/PaddleMIX/stargazers\"\u003e\u003cimg src=\"https://img.shields.io/github/stars/PaddlePaddle/PaddleMIX?color=ccf\"\u003e\u003c/a\u003e\n\n\u003c/p\u003e\n\u003c/div\u003e\n\n## 💌目录\n- [💌目录](#目录)\n- [📰新闻](#新闻)\n- [📣最新进展](#最新进展)\n- [🌈简介](#简介)\n- [✨主要特性](#主要特性)\n    - [📱丰富的多模态功能](#丰富的多模态功能)\n    - [🧩简洁的开发体验](#简洁的开发体验)\n    - [💡高性能分布式训推能力](#高性能分布式训推能力)\n    - [🔧特色功能与工具](#特色功能与工具)\n- [🔍安装](#安装)\n- [🔥教程](#教程)\n- [🤔FAQ](#faq)\n- [📱模型库](#模型库)\n- [📝许可证书](#许可证书)\n- [📌社区交流](#社区交流)\n\n\n## 📰新闻\n**🔥2025.01.07日直播课 飞桨PP系列模型上新！**\n\n- ✨PP-DocBee文档图像理解的新‘蜂’向标！\n为了帮助您迅速且深入地了解**PaddleMIX**的**PP-DocBee文档理解特色模型**，并熟练掌握实际操作技巧，百度高级研发工程师将在**1月7日（周二）19:00**，为您详细解读PP-DocBee的核心技术，手把手演示多模态大模型开发全流程。赶快扫描下方海报二维码预约报名！\n\u003cdetails\u003e\n\u003csummary\u003e点击展开活动海报\u003c/summary\u003e\n\u003cp align=\"center\"\u003e\n\u003cimg src='https://github.com/user-attachments/assets/3b7adc9e-c68d-44d1-9674-05b933947deb'  width=\"80%\"\u003e\n\u003c/p\u003e\n\u003c/details\u003e\n\n## 📣最新进展\n\n\u003c!-- 📚《飞桨多模态大模型开发套件PaddleMIX 2.1 震撼发布》，图文音视频场景全覆盖，多模态高效助力产业创新。超大规模训练支持，覆盖图文预训练、文生图、跨模态视觉任务，覆盖金融、教育、电商、医疗等产业场景。8月8日（周四）20：00 带你直播了解多模态大模型最新架构，深度解析PaddleMIX高性能模型库，手把手演示LLaVA模型训推全流程。[报名链接](https://www.wjx.top/vm/wKqysjx.aspx?udsid=449688)   --\u003e\n\n**🎉 2024.01.02 新增自研文档理解模型[PP-DocBee](./paddlemix/examples/ppdocbee)推理和训练，支持[高性能推理](./deploy/ppdocbee)**\n\n**🎉 2024.12.17 支持[GOT-OCR2_0](./paddlemix/examples/GOT_OCR_2_0)推理和训练**\n\n**🎉 2024.12.17 支持[InternVL2_5(1B、2B、4B、8B)](./paddlemix/examples/internvl2)推理**\n\n**🎉 2024.11.27 支持[Janus/JanusFlow](./paddlemix/examples/janus)推理**\n\n**🎉 2024.11.21 支持[MiniCPM-V-2_6](./paddlemix/examples/minicpm-v-2_6)推理**\n\n**🎉 2024.11.8 支持[DenseConnector](./paddlemix/examples/llava_denseconnector)和[Aquila-VL-2B-llava-qwen](./paddlemix/examples/llava_onevision/)推理**\n\n**🎉 2024.11.1 支持[LLaVA-OneVision](./paddlemix/examples/llava_onevision/)和[LLaVA-Critic](./paddlemix/examples/llava_critic/)推理**\n\n\n\u003cdetails\u003e\n\u003csummary\u003e点击展开更多\u003c/summary\u003e\n\n**🎉 2024.10.31 喜迎外部开发者的[创作教程页面](paddlemix_applications.md)更新**\n\n* 🌟 自9月6日发起大模型套件精品项目征集活动以来,我们收到了30个优质开发者项目,其中25个精品项目已通过平台评估并成功加精。\n\n* 🙏 衷心感谢各位开发者基于套件的精彩创作！🚀 诚挚邀请您也来分享您的创意 - 欢迎将教程发布到公开网页或[飞桨AI Studio](https://aistudio.baidu.com/aistudio/community/multimodal?from=singlemessage)社区！\n\n**🔥2024.10.11 发布PaddleMIX v2.1**\n* 支持[PaddleNLP 3.0 beta](https://github.com/PaddlePaddle/PaddleNLP/releases/tag/v3.0.0-beta0)版本，抢先体验其最新功能。\n* 新增[Qwen2-VL](./paddlemix/examples/qwen2_vl/)、[InternVL2](./paddlemix/examples/internvl2/)、[Stable Diffusion 3 (SD3)](https://github.com/PaddlePaddle/PaddleMIX/blob/develop/ppdiffusers/examples/dreambooth/README_sd3.md)等前沿模型。\n* 发布自研多模数据能力标签模型[PP-InsCapTagger](./paddlemix/datacopilot/example/pp_inscaptagger/)；可用于数据的分析和过滤，试验案例表明在保持模型效果的条件下可减少50%的数据量，大幅提高训练效率。\n\n* 多模态大模型InternVL2、LLaVA、SD3、SDXL适配昇腾910B，提供国产计算芯片上的训推能力。\n\n\n**2024.07.25 发布PaddleMIX v2.0**\n* 多模态理解：新增LLaVA系列，Qwen-VL等；新增Auto模块统一SFT训练流程；新增mixtoken训练策略，SFT吞吐量提升5.6倍。\n* 多模态生成：发布[PPDiffusers 0.24.1](./ppdiffusers/README.md)版本，支持视频生成能力，文生图模型新增LCM。新增飞桨版peft，accelerate后端。提供基于飞桨开发的ComfyUI插件。\n* 多模态数据处理工具箱[DataCopilot](./paddlemix/datacopilot/)：支持自定义数据结构，数据转换，离线格式检查；支持基本的统计信息，数据可视化功能。\n\n**2023.10.7 发布 PaddleMIX v1.0**\n* 新增图文预训练模型分布式训练能力，BLIP-2支持千亿规模训练\n* 新增跨模态应用流水线[AppFlow](./applications/README.md)，一键支持自动标注，图像编辑，音生图等11种跨模态应用\n* [PPDiffusers](./ppdiffusers/README.md)发布 0.19.3 版本，新增SDXL及相关任务\n\n\u003c/details\u003e\n\n---\n\n## 🌈简介\n\nPaddleMIX是基于飞桨的多模态大模型开发套件，聚合图像、文本、视频等多种模态，覆盖视觉语言预训练，微调，文生图，文生视频，多模态理解等丰富的多模态任务。它提供开箱即用的开发体验，同时支持灵活定制，满足不同需求，助力探索通用人工智能。\n\n\u003cp align=\"center\"\u003e\n  \u003cimg src=\"https://github.com/user-attachments/assets/764b32a4-3933-4ef8-a0b2-dd425af49ef8\" align=\"middle\" width = 100% /\u003e\n\u003c/p\u003e\n\nPaddleMIX工具链包括数据处理、模型开发、预训练、精调和推理部署，支持主流多模态模型如 EVA-CLIP、BLIP-2、Stable Diffusion 等。通过跨模态任务流水线 AppFlow 和文生图应用 pipeline，开发者可以快速构建多模态应用。\n\n### 多模态理解效果示例如下：\n\n\u003cimg src=\"https://github.com/user-attachments/assets/4c9a0427-57c7-4e1b-80f0-428c03119cc3\"\u003e\u003c/img\u003e\n\n\n多模态理解🤝融合了视觉👀和语言💬处理能力。包含基础感知、细粒度图像理解和复杂视觉推理🧠等功能。我们的[模型库](#模型库)调用提供了单图、多图和视频推理的功能实际应用，功能包括自然图像摘要📝、问答🤔、OCR🔍、情感识别❤️😢、专业图像分析🔬和代码解析💻。这些技术可应用于教育📚、医疗🏥、工业🏭等多个领域，实现从静态图像🖼️到动态视频🎥的全面智能分析。欢迎您的体验和探索～\n\n### 多模态生成效果示例如下：\n\u003cdiv style=\"display: flex; justify-content: center; gap: 5px;\"\u003e\n    \u003cimg src=\"https://github.com/user-attachments/assets/f4768f08-f7a3-45e0-802c-c91554dc5dfc\" style=\"height: 250px; object-fit: fill;\"\u003e\n    \u003cimg src=\"https://github.com/user-attachments/assets/9bf4a333-af57-4ddd-a514-617dea8da435\" style=\"height: 250px; object-fit: fill;\"\u003e\n\u003c/div\u003e\n\n\n多模态生成✍️融合了文本💬与视觉👀的创造能力。涵盖了从文字生成图像🖼️到文字生成视频🎥的各类技术，包括 Stable Diffusion 3、Open-Sora等先进模型。我们在[ppdiffusers](ppdiffusers/README.md)提供了单图生成、多图合成和视频生成的实际应用，功能涉及艺术创作🎨、动画制作📽️、内容生成📝等。通过这些技术，可以在教育📚、娱乐🎮、广告📺等领域实现从静态图像到动态视频的创意生成。欢迎您的体验和探索～\n\n### 特色应用效果示例如下（点击标题可快速跳转在线体验）：\n|                                                  [**ComfyUI创作工作流**](https://aistudio.baidu.com/community/app/106043)                                                  |                                                [**艺术风格二维码模型**](https://aistudio.baidu.com/community/app/1339)                                                |                                                  [**Mix叠图**](https://aistudio.baidu.com/community/app/1340)                                                  |\n| :--------------------------------------------------------------------------------------------------------------------------------------------: | :----------------------------------------------------------------------------------------------------------------------------------------------: | :--------------------------------------------------------------------------------------------------------------------------------------: |\n| \u003cimg src='https://github.com/PaddlePaddle/PaddleMIX/assets/35400185/36ba7261-1744-41a4-b1cb-c9e99f6931f2' width=\"300px\"\u003e | \u003cimg src='https://github.com/PaddlePaddle/Paddle/assets/22989727/ba091291-a1ee-49dc-a1af-fc501c62bfc8'  width=\"300px\"\u003e | \u003cimg src='https://github.com/PaddlePaddle/Paddle/assets/22989727/a71be5a0-b0f3-4aa8-bc20-740ea8ae6785'  width=\"300px\"\u003e |\n|                                                  [**二次元文生图**](https://aistudio.baidu.com/community/app/2/webUI?source=appCenter)                                                   |                                                     [**AI绘画｜50+Lora风格叠加**](https://aistudio.baidu.com/community/app/2848/webUI?source=appCenter)                                                     |                                               [**ControlNet｜图片局部重绘**](https://aistudio.baidu.com/community/app/1981/webUI?source=appCenter)                                               |\n| \u003cimg src='https://github.com/user-attachments/assets/a4af8f8a-08c7-4da7-8575-9dbfedaba56c' width=\"200px\"\u003e | \u003cimg src='https://github.com/user-attachments/assets/fa92c229-a885-46a1-b23f-a076855c93ec'  width=\"200px\"\u003e | \u003cimg src='https://github.com/user-attachments/assets/78625876-d8ec-4c15-ae96-655c50f562ab'  width=\"200px\"\u003e |\n\n\n\n\n\n-----\n\n\n\n\n\n\n\n\n## ✨主要特性\n\n### 📱丰富的多模态功能\nPaddleMIX支持大量最新主流的算法基准以及预训练模型，覆盖图文预训练，文生图，跨模态视觉任务，实现图像编辑、图像描述、数据标注等多样功能。`传送门`：[📱模型库](#模型库)\n\n### 🧩简洁的开发体验\nPaddleMIX 提供统一的模型开发接口，支持开发者快速集成和定制模型。借助 Auto 模块，用户可以高效加载预训练模型、实现 Tokenization，并通过简化的 API 轻松完成模型的训练、微调（SFT）、推理与部署。此外，Auto 模块支持开发者自定义模型的自动化集成，确保灵活性与可扩展性，同时提升开发效率。\n\n### 💡高性能分布式训推能力\nPaddleMIX提供高性能分布式训练与推理能力，融合✨Fused Linear✨、✨Flash Attention✨等加速算子，支持🌀BF16混合精度训练和4D混合并行策略，并通过优化推理性能，包括卷积布局、GroupNorm融合及旋转位置编码优化，显著提升大规模预训练和高效推理性能。\n\n\u003cimg src=\"https://github.com/user-attachments/assets/9ab9540a-fa89-41cb-838d-95df86e33382\" width = 100% /\u003e\n\n\n\n### 🔧特色功能与工具\n多模态数据处理工具箱DataCopilot，加速模型迭代升级。让开发者根据特定任务以低代码量实现数据的基本操作。`传送门`：[🏆特色模型|工具](#特色模型工具)\n\n\n## 🔍安装\n### 1. 克隆PaddleMIX仓库\n```\ngit clone https://github.com/PaddlePaddle/PaddleMIX\ncd PaddleMIX\n```\n\n### 2. 创建虚拟环境\n```\nconda create -n paddlemix python=3.10 -y\nconda activate paddlemix\n```\n### 3. ‼️安装PaddlePaddle\n\n#### 方法 1: 一键安装（GPU/CPU推荐）\n\n- CUDA 11.x或12.3\n- PaddlePaddle 3.0.0b1\n```\nsh build_paddle_env.sh\n```\n\n#### 方法 2: 手动安装\n关于PaddlePaddle安装的详细教程请查看[Installation](https://www.paddlepaddle.org.cn/install/quick?docurl=/documentation/docs/zh/develop/install/pip/linux-pip.html)。\n\n### 4. ‼️安装依赖\n\n#### 方法 1: 一键安装（推荐）\n\n运行以下命令来自动安装所有必要的依赖:\n```\nsh build_env.sh\n```\n\n#### 方法 2: 手动安装\n```bash\n# 安装 PaddleMIX\npip install -e .\n# 安装 ppdiffusers\ncd ppdiffusers\npip install -e .\ncd ..\n```\n### 5. ‼️验证安装\n```bash\nsh check_env.sh\n\n环境和依赖推荐版本:\n- paddlepaddle: 3.0.0b2或develop版本\n- paddlenlp: 3.0.0b2\n- ppdiffusers: 0.29.0\n- huggingface_hub: 0.23.0\n```\n\n### 6. 安装自定义算子（可选）\n* 部分模型需要安装自定义算子（FastLayerNorm、FusedLayerNorm），例如EVA-CLIP、DIT_LLAMA等。\n* 非CUDA环境（例如昇腾环境）则跳过\n```bash\ncd paddlemix/external_ops\npython setup.py install\n```\n\n## 🔥教程\n\n**快速开始**\n- [多模态理解：新手入门体验 [示例：InternVL2模型]](paddlemix/examples/internvl2/README.md)\n- [多模态生成：零基础上手指南 [示例：Stable Diffusion模型]](ppdiffusers/examples/stable_diffusion/README.md)\n- [跨模态任务流水线：快速开始](applications/README.md/#快速开始)\n\n**实操演练\u0026范例**\n- [LLaVA模型：从训练到推理的全流程实践](https://aistudio.baidu.com/projectdetail/7917712)\n- [SDXL应用：打造专属奥运海报生成器](https://aistudio.baidu.com/projectdetail/8251202)\n- [飞桨PaddleMIX跨模态AI应用：项目分类汇总](./paddlemix_applications.md)\n\n**多硬件使用**\n- 昇腾910B支持的模型列表和使用方式，可以参考[昇腾硬件使用](./docs/hardware_support/ascend_usage.md)\n\n\n**数据准备\u0026训练微调**\n- [模型训练与微调技巧](paddlemix/tools/README.md)\n\n**推理部署**\n- [部署指南：从开发到生产环境](deploy/README.md)\n\n\n## 📱模型库\n\u003ctable align=\"center\"\u003e\n  \u003ctbody\u003e\n    \u003ctr align=\"center\" valign=\"center\"\u003e\n      \u003ctd\u003e\n        \u003cb\u003e多模态理解\u003c/b\u003e\n      \u003c/td\u003e\n      \u003ctd\u003e\n        \u003cb\u003e多模态生成\u003c/b\u003e\n      \u003c/td\u003e\n      \u003ctd\u003e\n        \u003cb\u003e多模态大一统\u003c/b\u003e\n      \u003c/td\u003e\n    \u003c/tr\u003e\n    \u003ctr valign=\"top\"\u003e\n      \u003ctd\u003e\n        \u003cul\u003e\n        \u003c/ul\u003e\n          \u003cli\u003e\u003cb\u003e图文预训练\u003c/b\u003e\u003c/li\u003e\n        \u003cul\u003e\n            \u003cli\u003e\u003ca href=\"paddlemix/examples/clip\"\u003eCLIP\u003c/a\u003e\u003c/li\u003e\n            \u003cli\u003e\u003ca href=\"paddlemix/examples/evaclip\"\u003eEVA-CLIP\u003c/a\u003e\u003c/li\u003e\n            \u003cli\u003e\u003ca href=\"paddlemix/examples/llava\"\u003eLLaVA-1.5\u003c/a\u003e\u003c/li\u003e\n            \u003cli\u003e\u003ca href=\"paddlemix/examples/llava\"\u003eLLaVA-1.6\u003c/a\u003e\u003c/li\u003e\n            \u003cli\u003e\u003ca href=\"paddlemix/examples/llava\"\u003eLLaVA-NeXT\u003c/a\u003e\u003c/li\u003e\n            \u003cli\u003e\u003ca href=\"paddlemix/examples/llava_onevision\"\u003eLLaVA-onevision\u003c/a\u003e\u003c/li\u003e\n            \u003cli\u003e\u003ca href=\"paddlemix/examples/llava_onevision\"\u003eAquila-VL-2B-llava-qwen\u003c/a\u003e\u003c/li\u003e\n            \u003cli\u003e\u003ca href=\"paddlemix/examples/llava_critic\"\u003eLLaVA-Critic\u003c/a\u003e\u003c/li\u003e\n            \u003cli\u003e\u003ca href=\"paddlemix/examples/llava_denseconnector\"\u003eLLaVA-DenseConnector\u003c/a\u003e\u003c/li\u003e\n            \u003cli\u003e\u003ca href=\"paddlemix/examples/qwen_vl\"\u003eQwen-VL\u003c/a\u003e\u003c/li\u003e\n            \u003cli\u003e\u003ca href=\"paddlemix/examples/qwen2_vl\"\u003eQwen2-VL\u003c/a\u003e\u003c/li\u003e\n            \u003cli\u003e\u003ca href=\"paddlemix/examples/internvl2\"\u003eInternVL2\u003c/a\u003e\u003c/li\u003e\n            \u003cli\u003e\u003ca href=\"paddlemix/examples/minimonkey\"\u003eMini-Monkey\u003c/a\u003e\u003c/li\u003e\n            \u003cli\u003e\u003ca href=\"paddlemix/examples/coca\"\u003eCoCa\u003c/a\u003e\u003c/li\u003e\n            \u003cli\u003e\u003ca href=\"paddlemix/examples/blip2\"\u003eBLIP-2\u003c/a\u003e\u003c/li\u003e\n            \u003cli\u003e\u003ca href=\"paddlemix/examples/minigpt4\"\u003eminiGPT-4\u003c/a\u003e\u003c/li\u003e\n            \u003cli\u003e\u003ca href=\"paddlemix/examples/visualglm\"\u003eVIsualGLM\u003c/a\u003e\u003c/li\u003e\n            \u003cli\u003e\u003ca href=\"paddlemix/examples/cogvlm\"\u003eCogVLM \u0026\u0026 CogAgent\u003c/a\u003e\u003c/li\u003e\n            \u003cli\u003e\u003ca href=\"paddlemix/examples/internlm_xcomposer2\"\u003eInternLM-XComposer2\u003c/a\u003e\u003c/li\u003e\n      \u003c/ul\u003e\n      \u003c/ul\u003e\n          \u003cli\u003e\u003cb\u003e开放世界视觉模型\u003c/b\u003e\u003c/li\u003e\n        \u003cul\u003e\n            \u003cli\u003e\u003ca href=\"paddlemix/examples/groundingdino\"\u003eGrounding DINO\u003c/a\u003e\u003c/li\u003e\n            \u003cli\u003e\u003ca href=\"paddlemix/examples/sam\"\u003eSAM\u003c/a\u003e\u003c/li\u003e\n            \u003cli\u003e\u003ca href=\"paddlemix/examples/sam2\"\u003eSAM2\u003c/a\u003e\u003c/li\u003e\n            \u003cli\u003e\u003ca href=\"paddlemix/examples/YOLO-World\"\u003eYOLO-World\u003c/a\u003e\u003c/li\u003e\n      \u003c/ul\u003e\n      \u003c/ul\u003e\n          \u003cli\u003e\u003cb\u003e更多模态预训练模型\u003c/b\u003e\u003c/li\u003e\n        \u003cul\u003e\n            \u003cli\u003e\u003ca href=\"paddlemix/examples/imagebind\"\u003eImageBind\u003c/a\u003e\u003c/li\u003e\n      \u003c/ul\u003e\n      \u003c/ul\u003e\n        \u003cli\u003e\u003cb\u003e数据分析\u003c/b\u003e\u003c/li\u003e\n      \u003cul\u003e\n          \u003cli\u003e\u003ca href=\"./paddlemix/datacopilot/example/pp_inscaptagger/\"\u003ePP-InsCapTagger\u003c/a\u003e\u003c/li\u003e\n      \u003c/ul\u003e\n      \u003c/td\u003e\n      \u003ctd\u003e\n        \u003cul\u003e\n        \u003c/ul\u003e\n          \u003cli\u003e\u003cb\u003e文生图\u003c/b\u003e\u003c/li\u003e\n        \u003cul\u003e\n           \u003cli\u003e\u003ca href=\"ppdiffusers/examples/stable_diffusion\"\u003eStable Diffusion\u003c/a\u003e\u003c/li\u003e\n           \u003cli\u003e\u003ca href=\"ppdiffusers/ppdiffusers/pipelines/stable_diffusion_xl\"\u003eSDXL\u003c/a\u003e\u003c/li\u003e\n           \u003cli\u003e\u003ca href=\"ppdiffusers/examples/dreambooth/README_sd3.md\"\u003eStable Diffusion 3 (SD3)\u003c/a\u003e\u003c/li\u003e\n            \u003cli\u003e\u003ca href=\"ppdiffusers/examples/controlnet\"\u003eControlNet\u003c/a\u003e\u003c/li\u003e\n            \u003cli\u003e\u003ca href=\"ppdiffusers/examples/t2i-adapter\"\u003eT2I-Adapter\u003c/a\u003e\u003c/li\u003e\n            \u003cli\u003e\u003ca href=\"ppdiffusers/examples/text_to_image_laion400m\"\u003eLDM\u003c/a\u003e\u003c/li\u003e\n            \u003cli\u003e\u003ca href=\"ppdiffusers/ppdiffusers/pipelines/consistency_models\"\u003eConsistency Models\u003c/a\u003e\u003c/li\u003e\n            \u003cli\u003e\u003ca href=\"ppdiffusers/ppdiffusers/pipelines/deepfloyd_if\"\u003eDeepFloyd IF\u003c/a\u003e\u003c/li\u003e\n            \u003cli\u003e\u003ca href=\"ppdiffusers/ppdiffusers/pipelines/shap_e\"\u003eShap-E\u003c/a\u003e\u003c/li\u003e\n            \u003cli\u003e\u003ca href=\"ppdiffusers/examples/kandinsky2_2\"\u003eKandinsky-2\u003c/a\u003e\u003c/li\u003e\n            \u003cli\u003e\u003ca href=\"ppdiffusers/ppdiffusers/pipelines/wuerstchen\"\u003eWürstchen\u003c/a\u003e\u003c/li\u003e\n            \u003cli\u003e\u003ca href=\"ppdiffusers/ppdiffusers/pipelines/hotshot_xl\"\u003eHotshot-XL\u003c/a\u003e\u003c/li\u003e\n            \u003cli\u003e\u003ca href=\"ppdiffusers/ppdiffusers/pipelines/latent_consistency_models\"\u003eLCMs\u003c/a\u003e\u003c/li\u003e\n            \u003cli\u003e\u003ca href=\"ppdiffusers/ppdiffusers/pipelines/unidiffuser\"\u003eUnidiffuser\u003c/a\u003e\u003c/li\u003e\n            \u003cli\u003e\u003ca href=\"ppdiffusers/examples/class_conditional_image_generation/DiT\"\u003eDiT\u003c/a\u003e\u003c/li\u003e\n            \u003cli\u003e\u003ca href=\"ppdiffusers/examples/HunyuanDiT\"\u003eHunyuanDiT\u003c/a\u003e\u003c/li\u003e\n        \u003c/ul\u003e\n        \u003c/ul\u003e\n          \u003cli\u003e\u003cb\u003e文生视频\u003c/b\u003e\u003c/li\u003e\n        \u003cul\u003e\n           \u003cli\u003e\u003ca href=\"ppdiffusers/examples/text_to_video_lvdm\"\u003eLVDM\u003c/a\u003e\u003c/li\u003e\n           \u003cli\u003e\u003ca href=\"ppdiffusers/examples/stable_video_diffusion\"\u003eSVD\u003c/a\u003e\u003c/li\u003e\n           \u003cli\u003e\u003ca href=\"ppdiffusers/examples/AnimateAnyone\"\u003eAnimateAnyone\u003c/a\u003e\u003c/li\u003e\n           \u003cli\u003e\u003ca href=\"ppdiffusers/examples/Open-Sora\"\u003eOpenSora\u003c/a\u003e\u003c/li\u003e\n           \u003cli\u003e\u003ca href=\"ppdiffusers/ppdiffusers/pipelines/animatediff\"\u003eAnimateDiff\u003c/a\u003e\u003c/li\u003e\n           \u003cli\u003e\u003ca href=\"ppdiffusers/ppdiffusers/pipelines/text_to_video_synthesis\"\u003ezeroscope_v2_XL\u003c/a\u003e\u003c/li\u003e\n           \u003cli\u003e\u003ca href=\"ppdiffusers/examples/cogvideo\"\u003eCogVideoX\u003c/a\u003e\u003c/li\u003e\n        \u003c/ul\u003e\n        \u003c/ul\u003e\n          \u003cli\u003e\u003cb\u003e音频生成\u003c/b\u003e\u003c/li\u003e\n        \u003cul\u003e\n           \u003cli\u003e\u003ca href=\"ppdiffusers/ppdiffusers/pipelines/audioldm\"\u003eAudioLDM\u003c/a\u003e\u003c/li\u003e\n           \u003cli\u003e\u003ca href=\"ppdiffusers/ppdiffusers/pipelines/audioldm2\"\u003eAudioLDM2\u003c/a\u003e\u003c/li\u003e\n        \u003c/ul\u003e\n      \u003c/td\u003e\n      \u003ctd\u003e\n        \u003cul\u003e\n        \u003c/ul\u003e\n          \u003cli\u003e\u003cb\u003e统一多模态模型\u003c/b\u003e\u003c/li\u003e\n        \u003cul\u003e\n          \u003cli\u003e\u003ca href=\"paddlemix/examples/janus\"\u003eJanus\u003c/a\u003e\u003c/li\u003e\n        \u003c/ul\u003e\n      \u003c/td\u003e\n    \u003c/tr\u003e\n  \u003c/tbody\u003e\n\u003c/table\u003e\n\n更多模型能力，可参考[模型能力矩阵](./paddlemix/examples/README.md)\n\n\n\n## 📊多模数据处理工具箱DataCopilot\n\u003ctable align=\"center\"\u003e\n  \u003ctbody\u003e\n    \u003ctr align=\"center\" valign=\"center\"\u003e\n      \u003ctd\u003e\n        \u003cb\u003e基础能力\u003c/b\u003e\n      \u003c/td\u003e\n      \u003ctd\u003e\n        \u003cb\u003e数据分析\u003c/b\u003e\n      \u003c/td\u003e\n      \u003ctd\u003e\n        \u003cb\u003e数据生成\u003c/b\u003e\n      \u003c/td\u003e\n    \u003c/tr\u003e\n    \u003ctr valign=\"top\"\u003e\n      \u003ctd\u003e\n        \u003cul\u003e\n        \u003c/ul\u003e\n          \u003cli\u003e\u003cb\u003e使用文档\u003c/b\u003e\u003c/li\u003e\n        \u003cul\u003e\n            \u003cli\u003e\u003ca href=\"paddlemix/datacopilot\"\u003eDataCopilot\u003c/a\u003e\u003c/li\u003e\n      \u003c/ul\u003e\n      \u003c/td\u003e\n      \u003ctd\u003e\n        \u003cul\u003e\n        \u003c/ul\u003e\n          \u003cli\u003e\u003cb\u003e能力标签模型\u003c/b\u003e\u003c/li\u003e\n        \u003cul\u003e\n           \u003cli\u003e\u003ca href=\"paddlemix/datacopilot/example\"\u003ePP-InsCapTagger\u003c/a\u003e\u003c/li\u003e\n        \u003c/ul\u003e\n      \u003c/td\u003e\n      \u003ctd\u003e\n        \u003cul\u003e\n        \u003c/ul\u003e\n          \u003cli\u003e\u003cb\u003e文档类数据生成方案\u003c/b\u003e\u003c/li\u003e\n        \u003cul\u003e\n          \u003cli\u003e\u003ca href=\"paddlemix/datacopilot/example\"\u003ePP-InfinityDocData\u003c/a\u003e\u003c/li\u003e\n        \u003c/ul\u003e\n      \u003c/td\u003e\n    \u003c/tr\u003e\n  \u003c/tbody\u003e\n\u003c/table\u003e\n\n更多数据相关功能，可参考[DataCopilot](./paddlemix/datacopilot)主页\n\n\n## 🏆特色模型|工具\n\n### 💎跨模态任务流水线AppFlow\n\u003cdetails\u003e\n\u003csummary\u003e\u003cb\u003e 简介(点击展开)\u003c/b\u003e\u003c/summary\u003e\n\nAppFlow作为PaddleMIX的跨模态应用任务流水线，具备强大的功能与易用性。通过接入LLaVA、Stable Diffusion等前沿算法，AppFlow已全面覆盖图像、文本、音频、视频等多种模态，并通过流水线式的灵活组合，构建了10余种多模态应用，涵盖图文生成、文本视频生成、文本音频生成、图像理解等多个方面，为用户提供丰富的demo示例。AppFlow的特色在于其一键预测功能，用户无需繁琐训练与大量编码，仅需简单命令即可完成模型推理，极大地降低了使用门槛。同时，AppFlow充分利用飞桨框架动静统一优势，用户只需设置简单参数，即可自动完成模型的动转静导出及高性能推理，提高工作效率并优化模型性能，实现一站式应用部署。\n\n`传送门`：[应用文档示例](applications/README.md/#快速开始)。\n\n\u003c/details\u003e\n\n### 💎多模态数据处理工具箱DataCopilot\n\u003cdetails\u003e\n\u003csummary\u003e\u003cb\u003e 简介(点击展开)\u003c/b\u003e\u003c/summary\u003e\n\n在真实的应用场景有大量使用专有数据微调多模态大模型来提升模型效果的需求，此过程中数据要素成为核心。基于此PaddleMIX提供了数据处理和分析的工具DataCopilot，使开发者可在PaddleMIX套件完成端到端的开发体验。\n\nPP-InsCapTagger(Instance Capability Tagger) 是 DataCopilot 基于 PaddleMIX 实现的数据集能力标签模型，用于为多模态数据实例能力打标，通过实例能力分布对数据集进行优化，可以提高模型训练效率，为数据集分析和评价提供了一种高效的方案。 结合模型推理打标结果对LLaVA SFT数据集进行优化，可以**提高LLaVA模型SFT阶段50%的训练效率。**\n\n`传送门`：[应用文档示例](paddlemix/datacopilot/readme.md)。\n\n\u003c/details\u003e\n\n\u003cdetails\u003e\n\u003csummary\u003e\u003cb\u003e PP-InsCapTagger(点击展开)\u003c/b\u003e\u003c/summary\u003e\n\n| Model                           | ScienceQA                               | TextVQA                                | VQAv2                                  | GQA                                    | MMMU                                   | MME                                     |\n|----------------------------------|-----------------------------------------|----------------------------------------|----------------------------------------|----------------------------------------|----------------------------------------|-----------------------------------------|\n| llava-1.5-7b (origin)            | 66.8                                    | 58.2                                   | 78.5                                   | 62                                     | -                                      | -                                       |\n| llava-1.5-7b (rerun)             | 69.01                                   | 57.6                                   | 79                                     | 62.95                                  | 36.89                                  | 1521\u003cbr\u003e323                             |\n| llava-1.5-7b (random 50%)        | 67.31                                   | 55.6                                   | 76.89                                  | 61.01                                  | 34.67                                  | 1421\u003cbr\u003e286                             |\n| **llava-1.5-7b (our 50%)**       | **70.24** *(+2.93)*                     | **57.12** *(+1.52)*                    | **78.32** *(+1.43)*                    | **62.14** *(+1.13)*                    | **37.11** *(+2.44)*                    | **1476** *(+55)*\u003cbr\u003e**338** *(+52)*    |\n\n\n`传送门`：[应用文档示例](paddlemix/datacopilot/example/pp_inscaptagger/readme.md)。\n\u003c/details\u003e\n\n\n## 🤔FAQ\n关于我们项目的一些常见问题解答，请参考[FAQ](docs/FAQ.md)。如果您的问题没有得到解答，请随时在[Issues](https://github.com/PaddlePaddle/PaddleMIX/issues)中提出\n\n\n## 📝许可证书\n\n本项目的发布受[Apache 2.0 license](LICENSE)许可认证。\n\n## 📌社区交流\n\n- 微信扫描二维码并填写问卷，即可加入交流群与众多社区开发者以及官方团队深度交流。\n\u003cdiv align=\"center\"\u003e\n    \u003cimg src=\"https://github.com/user-attachments/assets/ecf292da-9ac6-41cb-84b6-df726ef4522d\" width=\"300\" height=\"300\" /\u003e\n\u003c/div\u003e\n","project_url":"https://awesome.ecosyste.ms/api/v1/projects/github.com%2Fpaddlepaddle%2Fpaddlemix","html_url":"https://awesome.ecosyste.ms/projects/github.com%2Fpaddlepaddle%2Fpaddlemix","lists_url":"https://awesome.ecosyste.ms/api/v1/projects/github.com%2Fpaddlepaddle%2Fpaddlemix/lists"}