Veröffentlicht am30. August 2026Llama Stack: Enterprise-KI-Plattform auf Kuberneteskubernetesllama-stackragai-agentsmcpvllmLlama Stack standardisiert Inference, RAG, Agents und Guardrails wie Kubernetes Container: eine API, austauschbare Provider — von Laptop bis Rechenzentrum.
Veröffentlicht am30. August 2026LLM-D: Verteilte Inference auf KuberneteskubernetesllminferencevllmaigpuLLM-D verteilt Inference über Kubernetes: Prefill/Decode trennen, KV-Cache nutzen, intelligent routen — niedrigere Latenz und bessere GPU-Kosten.
Veröffentlicht am30. August 2026Open-Source-AI-Stack auf Kuberneteskubernetesrayvllmpytorchaiopen-sourceOpen-Source-AI-Stack auf Kubernetes: Ray, PyTorch und vLLM als unabhängige Architektur — Schichten, Rollen und wann Self-Hosting sich lohnt.