yolov5 fp16 动态输入转 TensorRT 部署到 triton 服务
把 yolov5 训练出的 PyTorch 模型转换成 TensorRT 模型,扔进 triton 里部署。一条看似官方全程护航的流水线,实际每一步都有暗雷,本文按流程逐个排掉。
需求
- 为加快推理速度,把 fp32 精度的模型转成 fp16;
- 为支持 yolov5 动态 padding 和批推理,输入的 batch 和图片 size 需要是动态的。
版本
- yolov5:v6.1
- triton docker 镜像:22.08
- TensorRT:8.4.2.4
- cudnn:8.2.1.32
- CUDA To...