Tất cả bài viết
Computer Vision
YOLO
TensorRT
Edge AI
Camera AI
Deploy YOLO với TensorRT trên Edge GPU
Infratek AI Team·Computer Vision20 tháng 12, 202412 phút đọc
Deploy YOLO với TensorRT trên Edge GPU
Khi triển khai Camera AI cho 200+ camera, mỗi millisecond inference đều quan trọng. TensorRT là key để đạt real-time performance trên edge.
Tại sao TensorRT?
| Framework | FPS (YOLOv8-m, 640px) | Latency |
|---|---|---|
| PyTorch | 45 | 22ms |
| ONNX Runtime | 80 | 12.5ms |
| TensorRT FP16 | 180 | 5.5ms |
| TensorRT INT8 | 250 | 4ms |
Conversion Pipeline
# 1. Export to ONNX
yolo export model=yolov8m.pt format=onnx opset=17
# 2. Build TensorRT engine
trtexec --onnx=yolov8m.onnx \
--saveEngine=yolov8m_fp16.engine \
--fp16 \
--workspace=4096
INT8 Calibration
INT8 cho tốc độ cao nhất nhưng cần calibration dataset đại diện:
- Collect 500–1000 frames từ production cameras
- Cover các điều kiện ánh sáng khác nhau
- Include edge cases (night, rain, crowded)
Production Architecture
Edge device mỗi site chạy:
- TensorRT inference server
- Frame sampler (không cần process mọi frame)
- Kafka producer cho detection events
- Local buffer khi network down
Lessons learned
- Dynamic batching quan trọng khi số camera thay đổi
- Model ensemble không worth it trên edge — latency cost quá cao
- ROI cropping trước inference giảm 40% compute cho zone-specific detection