Tất cả bài viết
Computer Vision
YOLO
TensorRT
Edge AI
Camera AI

Deploy YOLO với TensorRT trên Edge GPU

Infratek AI Team·Computer Vision20 tháng 12, 202412 phút đọc

Deploy YOLO với TensorRT trên Edge GPU

Khi triển khai Camera AI cho 200+ camera, mỗi millisecond inference đều quan trọng. TensorRT là key để đạt real-time performance trên edge.

Tại sao TensorRT?

FrameworkFPS (YOLOv8-m, 640px)Latency
PyTorch4522ms
ONNX Runtime8012.5ms
TensorRT FP161805.5ms
TensorRT INT82504ms

Conversion Pipeline

# 1. Export to ONNX
yolo export model=yolov8m.pt format=onnx opset=17

# 2. Build TensorRT engine
trtexec --onnx=yolov8m.onnx \
        --saveEngine=yolov8m_fp16.engine \
        --fp16 \
        --workspace=4096

INT8 Calibration

INT8 cho tốc độ cao nhất nhưng cần calibration dataset đại diện:

  1. Collect 500–1000 frames từ production cameras
  2. Cover các điều kiện ánh sáng khác nhau
  3. Include edge cases (night, rain, crowded)

Production Architecture

Edge device mỗi site chạy:

  • TensorRT inference server
  • Frame sampler (không cần process mọi frame)
  • Kafka producer cho detection events
  • Local buffer khi network down

Lessons learned

  • Dynamic batching quan trọng khi số camera thay đổi
  • Model ensemble không worth it trên edge — latency cost quá cao
  • ROI cropping trước inference giảm 40% compute cho zone-specific detection