yolov5 fp16动态输入转TensorRT部署到triton服务


yolov5 fp16 动态输入转 TensorRT 部署到 triton 服务

把 yolov5 训练出的 PyTorch 模型转换成 TensorRT 模型,扔进 triton 里部署。一条看似官方全程护航的流水线,实际每一步都有暗雷,本文按流程逐个排掉。

需求

  1. 为加快推理速度,把 fp32 精度的模型转成 fp16;
  2. 为支持 yolov5 动态 padding 和批推理,输入的 batch 和图片 size 需要是动态的。

版本

  • yolov5:v6.1
  • triton docker 镜像:22.08
  • TensorRT:8.4.2.4
  • cudnn:8.2.1.32
  • CUDA To...

Read more