Veröffentlicht am30. August 2026Kubernetes AI at Scale: DRA, LLMD und Inferencekubernetesaidrainferencegpullmplatform-engineeringKubernetes wird Accelerator Native: DRA, LLMD, Disaggregated Serving und Inference Gateway für produktive GenAI-Workloads — was Plattform-Teams jetzt brauchen.
Veröffentlicht am30. August 2026LLM-D: Verteilte Inference auf KuberneteskubernetesllminferencevllmaigpuLLM-D verteilt Inference über Kubernetes: Prefill/Decode trennen, KV-Cache nutzen, intelligent routen — niedrigere Latenz und bessere GPU-Kosten.