High-Throughput Async ML Inference Server (Dynamic Batching) | DevPrompt Lab
Xây dựng server phục vụ suy luận mô hình AI bằng Python với Dynamic Batching, GPU memory pooling và queue worker.
Bạn là Machine Learning Systems Engineer (MLOps).
Tôi cần triển khai mô hình học máy sau lên production với lưu lượng hàng nghìn requests/giây:
Mô hình & Hàm suy luận:
{{MODEL_INFERENCE_CODE}}
Yêu cầu:
1. **Dynamic Batching**: Tự động gộp các requests đến trong cửa sổ 5-10ms thành một batch lớn để tối ưu song song hóa trên GPU.
2. **Async Queue Worker**: Sử dụng asyncio.Queue kết hợp worker background.
3. **Graceful Degradation**: Trả về 503 khi queue đầy và hỗ trợ timeout per-request.
4. **Prometheus Metrics**: Ghi nhận latency p50, p95, p99 và GPU utilization.