Inference-Plattform: eine bereinigte Fallstudie
Wie eine GitOps-verwaltete vLLM-Inferenz-Plattform tatsächlich funktionierte: ein OpenAI-kompatibler Router vor GPU-Profilen, Hot Swaps mit Readiness-Gate, Streaming-Passthrough, token-genaue Telemetrie und ein Offline-Modellcache.