awesome-cuda-and-hpc
🚀🚀🚀 This repository lists some awesome public CUDA, cuda-python, cuBLAS, cuDNN, CUTLASS, TensorRT, TensorRT-LLM, Triton, TVM, MLIR, PTX and High Performance Computing (HPC) projects.
https://github.com/coderonion/awesome-cuda-and-hpc
Last synced: 11 days ago
JSON representation
-
Applications
- kalfazed/tensorrt_starter
- emptysoal/cuda-image-preprocess - image-preprocess?style=social"/> : Speed up image preprocess with cuda when handle image or tensorrt inference. Cuda编程加速图像预处理。
- laugh12321/TensorRT-YOLO - YOLO?style=social"/> : 🚀 TensorRT-YOLO: Support YOLOv3, YOLOv5, YOLOv6, YOLOv7, YOLOv8, YOLOv9, YOLOv10, PP-YOLOE using TensorRT acceleration with EfficientNMS! TensorRT-YOLO 是一个支持 YOLOv3、YOLOv5、YOLOv6、YOLOv7、YOLOv8、YOLOv9、YOLOv10、PP-YOLOE 和 PP-YOLOE+ 的推理加速项目,使用 NVIDIA TensorRT 进行优化。项目不仅集成了 EfficientNMS TensorRT 插件以增强后处理效果,还使用了 CUDA 核函数来加速前处理过程。TensorRT-YOLO 提供了 C++ 和 Python 推理的支持,旨在提供快速而优化的目标检测解决方案。
- l-sf/Linfer - sf/Linfer?style=social"/> : 基于TensorRT的C++高性能推理库,Yolov10, YoloPv2,Yolov5/7/X/8,RT-DETR,单目标跟踪OSTrack、LightTrack。
- Melody-Zhou/tensorRT_Pro-YOLOv8 - Zhou/tensorRT_Pro-YOLOv8?style=social"/> : This repository is based on [shouxieai/tensorRT_Pro](https://github.com/shouxieai/tensorRT_Pro), with adjustments to support YOLOv8. 目前已支持 YOLOv8、YOLOv8-Cls、YOLOv8-Seg、YOLOv8-OBB、YOLOv8-Pose、RT-DETR、ByteTrack、YOLOv9、YOLOv10、RTMO 高性能推理!!!🚀🚀🚀
- shouxieai/tensorRT_Pro
- shouxieai/infer
- hamdiboukamcha/yolov10-tensorrt - tensorrt?style=social"/> : YOLOv10 C++ TensorRT : Real-Time End-to-End Object Detection.
- triple-Mu/YOLOv8-TensorRT - Mu/YOLOv8-TensorRT?style=social"/> : YOLOv8 using TensorRT accelerate !
- FeiYull/TensorRT-Alpha - AI-IOT/torch2trt?style=social"/> : 🔥🔥🔥TensorRT for YOLOv8、YOLOv8-Pose、YOLOv8-Seg、YOLOv8-Cls、YOLOv7、YOLOv6、YOLOv5、YOLONAS......🚀🚀🚀CUDA IS ALL YOU NEED.🍎🍎🍎
- cyrusbehr/YOLOv8-TensorRT-CPP - TensorRT-CPP?style=social"/> : YOLOv8 TensorRT C++ Implementation. A C++ Implementation of YoloV8 using TensorRT Supports object detection, semantic segmentation, and body pose estimation.
- VIDIA-AI-IOT/torch2trt - AI-IOT/torch2trt?style=social"/> : An easy to use PyTorch to TensorRT converter.
- zhiqwang/yolort
- Linaom1214/TensorRT-For-YOLO-Series - For-YOLO-Series?style=social"/> : YOLO Series TensorRT Python/C++. tensorrt for yolo series (YOLOv8, YOLOv7, YOLOv6....), nms plugin support.
- wang-xinyu/tensorrtx - xinyu/tensorrtx?style=social"/> : TensorRTx aims to implement popular deep learning networks with tensorrt network definition APIs.
- DefTruth/lite.ai.toolkit
- PaddlePaddle/FastDeploy - to-use and Fast Deep Learning Model Deployment Toolkit for ☁️Cloud 📱Mobile and 📹Edge. Including Image, Video, Text and Audio 20+ main stream scenarios and 150+ SOTA models with end-to-end optimization, multi-platform and multi-framework support.
- enazoe/yolo-tensorrt - tensorrt?style=social"/> : TensorRT8.Support Yolov5n,s,m,l,x .darknet -> tensorrt. Yolov4 Yolov3 use raw darknet *.weights and *.cfg fils. If the wrapper is useful to you,please Star it.
- guojianyang/cv-detect-robot - detect-robot?style=social"/> : 🔥🔥🔥🔥🔥🔥Docker NVIDIA Docker2 YOLOV5 YOLOX YOLO Deepsort TensorRT ROS Deepstream Jetson Nano TX2 NX for High-performance deployment(高性能部署)。
- BlueMirrors/Yolov5-TensorRT - TensorRT?style=social"/> : Yolov5 TensorRT Implementations.
- lewes6369/TensorRT-Yolov3 - Yolov3?style=social"/> : TensorRT for Yolov3.
- CaoWGG/TensorRT-YOLOv4 - YOLOv4?style=social"/> :tensorrt5, yolov4, yolov3,yolov3-tniy,yolov3-tniy-prn.
- isarsoft/yolov4-triton-tensorrt - triton-tensorrt?style=social"/> : YOLOv4 on Triton Inference Server with TensorRT.
- TrojanXu/yolov5-tensorrt - tensorrt?style=social"/> : A tensorrt implementation of yolov5.
- tjuskyzhang/Scaled-YOLOv4-TensorRT - YOLOv4-TensorRT?style=social"/> : Implement yolov4-tiny-tensorrt, yolov4-csp-tensorrt, yolov4-large-tensorrt(p5, p6, p7) layer by layer using TensorRT API.
- Syencil/tensorRT - 7 Network Lib 包括常用目标检测、关键点检测、人脸检测、OCR等 可训练自己数据。
- SeanAvery/yolov5-tensorrt - tensorrt?style=social"/> : YOLOv5 in TensorRT.
- Monday-Leo/YOLOv7_Tensorrt - Leo/YOLOv7_Tensorrt?style=social"/> : A simple implementation of Tensorrt YOLOv7.
- ibaiGorordo/ONNX-YOLOv6-Object-Detection - YOLOv6-Object-Detection?style=social"/> : Python scripts performing object detection using the YOLOv6 model in ONNX.
- ibaiGorordo/ONNX-YOLOv7-Object-Detection - YOLOv7-Object-Detection?style=social"/> : Python scripts performing object detection using the YOLOv7 model in ONNX.
- triple-Mu/yolov7 - Mu/yolov7?style=social"/> : End2end TensorRT YOLOv7.
- hewen0901/yolov7_trt
- tsutof/tiny_yolov2_onnx_cam
- Monday-Leo/Yolov5_Tensorrt_Win10 - Leo/Yolov5_Tensorrt_Win10?style=social"/> : A simple implementation of tensorrt yolov5 python/c++🔥
- Wulingtian/yolov5_tensorrt_int8
- Wulingtian/yolov5_tensorrt_int8_tools
- MadaoFY/yolov5_TensorRT_inference
- ibaiGorordo/ONNX-YOLOv8-Object-Detection - YOLOv8-Object-Detection?style=social"/> : Python scripts performing object detection using the YOLOv8 model in ONNX.
- we0091234/yolov8-tensorrt - tensorrt?style=social"/> : yolov8 tensorrt 加速.
- cvdong/YOLO_TRT_SIM
- cvdong/YOLO_TRT_PY
- Psynosaur/Jetson-SecVision - SecVision?style=social"/> : Person detection for Hikvision DVR with AlarmIO ports, uses TensorRT and yolov4.
- tatsuya-fukuoka/yolov7-onnx-infer - fukuoka/yolov7-onnx-infer?style=social"/> : Inference with yolov7's onnx model.
- ervgan/yolov5_tensorrt_inference
- AlbinZhu/easy-trt - trt?style=social"/> : TensorRT for YOLOv10 with CUDA.
- dusty-nv/jetson-utils - nv/jetson-utils?style=social"/> : C++/CUDA/Python multimedia utilities for NVIDIA Jetson.
- Alisah-Ozcan/GPU-FFT - Ozcan/GPU-FFT?style=social"/> : Welcome to the GPU-FFT-Optimization repository! We present cutting-edge algorithms and implementations for optimizing the Fast Fourier Transform (FFT) on Graphics Processing Units (GPUs).
- owensgroup/RXMesh - accelerated triangle mesh processing. RXMesh is a surface triangle mesh data structure and programming model for processing static meshes on the GPU. RXMesh aims at provides a high-performance, generic, and compact data structure that can handle meshes regardless of their quality (e.g., non-manifold).
- rapidsai/cugraphs - RAPIDS Graph Analytics Library. [docs.rapids.ai/api/cugraph/stable/](https://docs.rapids.ai/api/cugraph/stable/)
-
Awesome List
- Erkaman/Awesome-CUDA - CUDA?style=social"/> : This is a list of useful libraries and resources for CUDA development.
- jslee02/awesome-gpgpu - gpgpu?style=social"/> : 😎 A curated list of awesome GPGPU (CUDA/OpenCL/Vulkan) resources.
- mikeroyal/CUDA-Guide - Guide?style=social"/> : A guide covering CUDA including the applications and tools that will make you a better and more efficient CUDA developer.
- rkinas/triton-resources - resources?style=social"/> : A curated list of resources for learning and exploring Triton, OpenAI's programming language for writing efficient GPU code.
-
Blogs
- Modular Blog
- 2023-03-23,AI’s compute fragmentation: what matrix multiplication teaches us
- 2023-04-20,The world's fastest unified matrix multiplication
- 2023-05-02,A unified, extensible platform to superpower your AI
- 2023-08-18,How Mojo🔥 gets a 35,000x speedup over Python – Part 1
- 2023-08-28,How Mojo🔥 gets a 35,000x speedup over Python – Part 2
- 2023-09-06,Mojo🔥 - A journey to 68,000x speedup over Python - Part 3
- 2024-02-12,Mojo vs. Rust: is Mojo 🔥 faster than Rust 🦀 ?
- 2024-04-10,Row-major vs. column-major matrices: a performance analysis in Mojo and NumPy
- 2021-03-23,张先轶博士:OpenBLAS项目与矩阵乘法优化
- 2023-11-11, 朱懿:HPC之矩阵乘法高性能实验报告
- 2023-06-16,SIMD 指令集与数据并行程序
- 2024-05-21,并行计算:超级大脑背后的魔术师
- 2024-06-29,BLAS简介:基于Fortran的高性能矩阵计算基础库
- 2024-07-08,LAPACK简介:基于Fortran的高性能线性代数工具箱
- 2024-07-12,使用SIMD优化二叉搜索树
- 2024-06-21,YOLOv10在PyTorch和OpenVINO中推理对比
- 知乎「白牛」
- 2023-05-04,OpenBLAS gemm从零入门
- 知乎「庄碧晨」
- 2021-01-22,多线程 GEMM 论文 笔记
- 知乎「OeuFcoque」
- 2020-04-12,高性能计算简介(一):初步分析,BLAS,BLIS简介
- 知乎「赵小明12138」
- 2022-10-26,并行计算-canon算法:矩阵相乘
- 知乎「zero」
- 2021-12-18,稠密矩阵乘003(gemm)-OpenBLAS和BLIS分块策略
- 知乎「严忻恺」
- 2022-03-31,斯坦福CS217(三)GEMM计算加速
- 黎明灰烬 博客
- 2019-06-12,通用矩阵乘(GEMM)优化算法
- 2023-10-27,现已公开发布!欢迎使用 NVIDIA TensorRT-LLM 优化大语言模型推理
- 2023-11-24,使用 NVIDIA IGX Orin 开发者套件在边缘部署大语言模型
- 2024-06-03,COMPUTEX 2024 | “加速一切”,NVIDIA CEO 黄仁勋在 COMPUTEX 开幕前发表主题演讲
- 2024-06-19,NVIDIA CEO 黄仁勋寄语毕业生:“对非常规、未经探索的东西保持信仰”
- 2024-04-24,NVIDIA GPU 架构下的 FP8 训练与推理
- 2024-06-14,初创加速计划 | 基于 NVIDIA Jetson 平台,国讯芯微实现大小脑端到端协同控制
- 2024-06-20,NVIDIA Isaac Sim 4.0 和 NVIDIA Isaac Lab 为机器人工作流和仿真提供强大助力
- 2024-06-21,消除仿真与现实之间的差距:使用 NVIDIA Isaac Lab 训练 Spot 四足机器人运动
- 2024-07-01,NVIDIA 端到端解决方案助力理想汽车打造智能驾驶体验与个性化车内空间
- 2024-03-20,C++模板推导再炫技:统一AI各个device各个kernel的调用和分发
- 2024-04-09,全网首篇从tensorRT-LLM MoE CUDA kernel角度理解Mixtral-8x7b的推理加速及展望
- 2024-05-10,全面探究GPU SM内CUDA core-Tensor core能否同时计算?(上篇)
- 2024-05-16,全面探究GPU SM内CUDA core-Tensor core能否同时计算?(下篇)
- 2022-10-18,深入浅出GPU优化系列:reduce优化
- 2022-10-31,深入浅出GPU优化系列:spmv优化
- 2023-05-24,深入浅出GPU优化系列:gemv优化
- 2023-05-24,深入浅出GPU优化系列:GEMM优化(一)
- 2023-06-02,深入浅出GPU优化系列:GEMM优化(二)
- 2023-06-16,深入浅出GPU优化系列:GEMM优化(三)
- 2023-06-26,深入浅出GPU优化系列:elementwise优化及CUDA工具链介绍
- 2023-06-27,漫谈高性能计算与性能优化:访存
- 2024-07-04,澎峰科技研发的高性能计算原语库PerfIPP库技术白皮书发布(附下载)
- 2024-03-11,图解Mixtral 8 * 7b推理优化原理与源码实现
- 2024-03-29,图解大模型计算加速系列之:vLLM核心技术PagedAttention原理
- 2024-04-06,图解大模型计算加速系列:vLLM源码解析1,整体架构
- 2024-04-12,图解大模型计算加速系列:vLLM源码解析2,调度器策略(Scheduler)
- 2024-04-19,从啥也不会到Cuda GEMM优化
- 2024-03-19,NVIDIA大语言模型落地的全流程解析
- 2024-03-20,TensorRT-LLM初探(二)简析了结构,用的更明白
- 2024-03-21,高性能 LLM 推理框架的设计与实现
- 2024-04-15,[深入分析CUTLASS系列
- 2024-04-21,搞懂 NVIDIA GPU 性能指标 很容易弄混的一个概念: Utilization vs Saturation
- 2024-04-22,快速提升性能,如何更好地使用GPU(上)
- 2024-05-14,快速提升性能,如何更好地使用GPU(下)
- 2024-05-22,大模型精度(FP16,FP32,BF16)详解与实践
- 2024-07-24,CUDA性能简易优化(一)背景知识
- 2024-01-09,LLM推理库TensorRT-LLM深入分析
- 2024-04-10,一文上手 Tensor Core指令级编程
- 2024-04-23,大语言模型量化
- 2024-04-25,动手实现混合精度矩阵乘CUDA内核
- 2024-04-26,一文了解CUDA矩阵乘编程
- 2024-04-20,Tensor Cores 使用介绍
- 2024-05-27,[并行训练
- 2024-06-20, FP8量化解读--8bit下最优方案?(一)
- 2024-07-01,CUDA-MODE 课程笔记 第一课: 如何在 PyTorch 中 profile CUDA kernels
- 2024-07-04,CUDA-MODE 第一课课后实战(上)
- 2024-07-06,CUDA-MODE 课程笔记 第二课: PMPP 书的第1-3章速通
- 2024-07-13,CUDA-MODE 课程笔记 第四课: PMPP 书的第4-5章笔记
- 2024-07-18,CUDA-MODE课程笔记 第6课: 如何优化PyTorch中的优化器
- 2024-07-23,CUTLASS 2.x & CUTLASS 3.x Intro 学习笔记
- 2017-12-07,【推荐】CUTLASS:CUDA C++高性能线性代数运算库
- 2024-02-28,熬了几个通宵,我写了份CUDA新手入门代码
- 2024-05-13,Shared memory!CUDA数据拷贝速度拉满~
- 2024-03-29,大语言模型硬件加速器综述
- 2024-04-10,【太疯狂了】用 1000 行纯 C 代码实现 GPT-2 训练:Andrej Karpathy重塑LLM训练格局
- 2024-04-14,【全球黑客加持】Karpathy 1000行纯C训练大模型速度已追平PyTorch
- 2024-01-26,基于TensorRT-LLM的大模型部署(速通笔记)
- 2024-04-09,“真男人就应该用 C 编程”!用 1000 行 C 代码手搓了一个大模型,Mac 即可运行,特斯拉前AI总监爆火科普 LLM
- 2024-04-09,纯C语言手搓GPT-2,前OpenAI、特斯拉高管新项目火了
- 2024-05-20,首个GPU高级语言,大规模并行就像写Python,已获8500 Star
- 2023-09-10,H100推理飙升8倍!英伟达官宣开源TensorRT-LLM,支持10+模型
- 2024-04-07,Llama提速500%!谷歌美女程序员手搓矩阵乘法内核
- 2024-04-09,1000行C语言搓出GPT-2!AI大神Karpathy新项目刚上线就狂揽2.5k星
- 2024-04-11,llm.c:实现了大语言模型(LLM)训练的简单、纯 C/CUDA 版本,无需 PyTorch 或 cPython
- 2024-04-17,NVIDIA希望有更多支持CUDA的编程语言
- 2022-10-16,TensorRT/CUDA超全代码资料仓库
- 2024-04-11,美团外卖基于GPU的向量检索系统实践
- 2024-04-20,英伟达开源人工智能代数库:线性代数子例程的 CUDA 模板
- 2024-03-18,LLM百倍推理加速之量化篇
- 2024-03-22,LLM推理:GPU资源和推理框架选择
- 2024-03-27,LLM 推理加速方式汇总
- 2024-04-26,LLM推理量化:FP8 VS INT8
- 2024-04-28,Nvidia GPU池化-远程GPU
- 2024-05-01,Nvidia Tensor Core 初探
- 2024-05-24,Pytorch 显存管理机制与显存占用分析方法
- 2024-06-02,[LLM推理优化
- 2024-02-25,英伟达(NVIDA)崛起不平凡之路--老黄全球AI芯片新帝国简史
- 2022-08-08,【机器学习】K均值聚类算法原理
- 2022-08-11,【CUDA编程】基于CUDA的Kmeans算法的简单实现
- 2024-01-24,【CUDA编程】基于 CUDA 的 Kmeans 算法的进阶实现(二)
- 2024-04-08,【CUDA编程】CUDA 统一内存
- 2023-09-06,GPU底层优化,如何让Transformer在GPU上跑得更快?
- 2024-04-12,深入浅出,PyTorch模型int8量化原理拆解
- 2024-04-13,CUDA模型部署实战,自己写的CUDA矩阵乘法能优化到多快?
- 2024-04-22,CUDA编程中,Tensor Cores的详细拆解
- 2024-06-22,FP8量化解读,8bit下部署最优方案?
- 2024-06-26,Cuda编程实践,我的第一份Cuda代码
- 2024-03-25,理解NVIDIA GPU 性能:利用率与饱和度
- 2024-04-30,加速矩阵计算:英伟达TensorCore架构演进与原理最全解析
- 2024-05-15,揭秘 Tensor Core 底层:如何让AI计算速度飞跃
- 2024-05-27,浅析GPU分布式通信技术-PCle、NVLink、NVSwitch
- 2024-04-19,AI 推理:CPU 的崛起
- 2023-07-21,AI模型部署 | TensorRT模型INT8量化的Python实现
- 2023-10-30,利用NVIDIA Jetson Orin的强大能力执行本地LLM模型
- 2024-05-07,基于NVIDIA Jetson AGX Orin和Audio2Face做一个AI聊天数字人
- 2024-05-14,CUDA与OpenCL:并行计算革命的冲突与未来
- 2024-05-11,我找到了AlexNet当年的源代码,没用框架,从零手撸CUDA/C++
- 2024-04-10,针对大型语言模型的高效CUDA优化可实现性能翻倍提升
- 2024-06-21,解密高性能计算:如何用流和Kernel触发提升GPU通信效率
- 2024-04-19,英伟达坚持了16年的CUDA,到底是什么
- 2024-04-09,100行C代码重塑深度学习:用纯C/CUDA打造的极简LLM训练
- 2024-03-29,图像预处理库CV-CUDA开源了,打破预处理瓶颈,提升推理吞吐量20多倍
- 2024-02-26,GPU(一)GPU简介
- 2024-04-03,【CUDA】一文讲清流与并发,讲不清我重讲
- 2024-05-02,【【CUDA】一文讲清共享内存和常量内存
- 2022-09-19,零知识证明 - FPGA vs. GPU
- 2022-06-16,减少重复造轮子,帮你解放生产力的「小矩阵功能」来啦!
- 2024-06-03,黄仁勋:英伟达将一年推一款全新芯片,没有英伟达就没有今天AI的一切(附最新演讲全文)
- 2024-06-01,传统SLAM使用CUDA加速是否有比较大的优势呢?
- 2024-06-01,黄仁勋:不喜欢裁员,我宁愿“折磨”他们|中企荐读
- 2024-06-04,使用 TensorRT C++ API 调用GPU加速部署 YOLOv10 实现 500FPS 推理速度——快到飞起!!
- 2023-06-12,为CUDA Kernel选择合适的grid_size和block_size
- 2024-06-20,大模型量化性能评价指标
- 2024-06-24,FP8 量化基础 - 英伟达
- 2024-07-05,聊聊大模型推理中的分离式推理
- 2024-07-11,FP8 低精度训练:Transformer Engine 简析
Programming Languages
Categories
Sub Categories
Keywords
cuda
64
rust
33
gpu
31
tensorrt
30
deep-learning
24
llm
23
pytorch
19
nvidia
19
python
19
machine-learning
17
yolov5
16
llama
12
yolo
12
neural-network
12
cuda-programming
12
yolov8
11
cpp
11
onnx
11
inference
11
cublas
10
cuda-kernels
10
ai
10
gpgpu
9
openai
9
object-detection
9
cudnn
8
vulkan
8
gemm
7
yolov7
7
yolov3
7
gpu-programming
7
chatgpt
7
mlir
7
hpc
6
gpt
6
gpu-computing
6
qwen
6
rocm
6
opencl
6
llama3
6
yolox
5
jetson
5
onnxruntime
5
deepseek
5
tensorflow
5
triton
5
computer-vision
5
yolov4
5
llm-inference
5
tensor
5