Zum Inhalt springen

Betrieb & Hardware

Start4 · Betrieb & Hardware

Betrieb & Hardware – wo das Modell tatsächlich läuft

Ein Modell ist nur eine Datei. Damit es antwortet, braucht es eine Runtime (Betriebs-Software) und Hardware mit genug Rechenleistung. Die Grundsatzfrage: lokal (bei dir) oder Cloud (beim Anbieter)?

LOKAL — „On-Premise“ Daten bleiben im Haus · keine Token-Kosten · du wartest selbst Deine Anwendung / Chat-UI (Open WebUI) spricht lokale API an Runtime: Ollama (einfach) · vLLM (Profi) · NIM (fertig) lädt Modell-Datei, verwaltet Speicher, stellt API bereit Offenes Modell (Llama · Qwen · gpt-oss), quantisiert heruntergeladen von Hugging Face GPU (CUDA) · Gaming-PC · Mac · DGX Spark (GB10) CLOUD — beim Anbieter Top-Modelle · null Wartung · Bezahlung pro Token Deine Anwendung / ChatGPT / Claude-App Anfrage übers Internet (API-Key) Anbieter-Infrastruktur (OpenAI · Anthropic · Google) verteilt Millionen Anfragen auf Serverfarmen Geschlossenes Spitzenmodell (GPT · Claude · Gemini) Gewichte bleiben geheim Rechenzentren mit zehntausenden GPUs Hybrid-Praxis: sensible Aufgaben links, anspruchsvollste rechts — umgeschaltet per LiteLLM / OpenRouter
Schaubild 6: Beide Welten haben denselben Vier-Schichten-Aufbau (Anwendung → Runtime/Infrastruktur → Modell → Hardware) – der Unterschied ist nur, wer die unteren Schichten betreibt und bezahlt.
KriteriumLokalCloud
DatenschutzSehr hoch – nichts verlässt das HausVom Anbieter abhängig
KostenHardware vorab, dann ~kostenlosKein Invest, dann pro Token
QualitätGut (offene Modelle holen auf)Spitze (GPT, Claude, Gemini)
WartungDu selbstAnbieter
Offline / SkalierungOffline ja / Hardware-GrenzeInternet nötig / unbegrenzt

Die Runtimes & Plattformen

Ollama Lokaler Modell-Starter

Das einfachste Werkzeug für lokale Modelle: ollama run llama3 lädt und startet – fertig. Ideal für Einzelpersonen, Experimente, Laptop/PC/Mac.

Analogie: „App Store + Play-Knopf“ für lokale KI.
Ollama — Der einfachste Weg zu lokaler KI
Gleiche Kategorie:LM Studiollama.cppJanGPT4All

vLLM Hochleistungs-Serving

Runtime für den Profi-Betrieb: maximaler Durchsatz, viele parallele Anfragen, effiziente GPU-Auslastung. Standard, wenn ein Modell für Team oder Produkt laufen soll.

Analogie: Ollama = Espressomaschine für zuhause, vLLM = Industrie-Kaffeeanlage für die Kantine.
vLLM — Die Profi-Runtime für hohen Durchsatz

Nvidia NIM NVIDIA Inference Microservices Fertige Modell-Container

Schlüsselfertige Pakete von Nvidia: Modell + optimierte Runtime + API in einem Container. Starten, läuft – ohne selbst an der Runtime zu schrauben.

Analogie: Fertiggericht statt selbst kochen – Zielgruppe: Firmen, die schnell produktiv gehen wollen.
Nvidia NIM — Fertige Modell-Container — Enterprise-Komfort mit Nvidia-Bindung

Hugging Face „GitHub der KI-Modelle“

Die zentrale Tauschbörse der offenen KI-Welt: Fast jedes offene Modell, Feintuning und Dataset wird hier veröffentlicht und von dort in Ollama/vLLM geladen.

Merke: Der Hub ist ein Paketmanager, keine Runtime – dort wird geladen, ausgeführt wird woanders.

→ Der komplette Arbeitsablauf (Suchen, Filtern, Laden, Prüfen) steht auf der Seite Modellwahl & Bezug.

Hugging Face — Die Tauschbörse und Infrastruktur der offenen KI-Welt

GPU & CUDA Grafikprozessor & Nvidias Software-Brücke

Die GPU (Grafikprozessor) kann tausende Rechnungen gleichzeitig – perfekt für Tensor-Mathematik. CUDA ist Nvidias Programmierschicht, über die Software auf die GPU zugreift – und der Hauptgrund für Nvidias Dominanz: fast alle KI-Software ist auf CUDA gebaut.

GPU & CUDA — Der Muskel der KI — und Nvidias Burggraben

GB10 · DGX Spark · DGX OS Nvidias Desktop-KI-Paket

Drei Begriffe, ein Produkt: Der GB10 (Grace-Blackwell-Superchip, CPU+GPU vereint, ~1 PetaFLOP) steckt im DGX Spark – einem brotdosengroßen „Desktop-KI-Supercomputer“ mit 128 GB gemeinsamem Speicher. Darauf vorinstalliert: DGX OS, Nvidias Linux mit komplettem KI-Software-Stack.

GB10 · DGX Spark · DGX OS — Nvidias Desktop-KI-Paket: Chip, Gerät, Betriebssystem

Quantisierung Quantization Modell-Kompression

Das „Schrumpfen“ eines Modells, indem jeder Parameter mit weniger Bits gespeichert wird (16-Bit → 4-Bit): ~75 % weniger Speicher bei geringem Qualitätsverlust. Der Schlüssel, warum große Modelle auf normalen PCs laufen. Welche Stufe wann: Modellwahl.

Quantisierung — Modelle schrumpfen, damit sie auf echte Hardware passen

Edge AI KI am Rand des Netzes

KI, die direkt auf dem Endgerät läuft – Smartphone, Auto, Kamera, Industriesensor – statt in Cloud oder Rechenzentrum. „Edge“ = der Rand des Netzwerks, nah an dem Ort, wo Daten entstehen.

Einordnung: Die Steigerung von „lokal“: nicht mal mehr ein eigener Server – das Gerät selbst denkt (z.B. „Apple Intelligence“ auf dem iPhone).
Edge AI — KI direkt auf dem Endgerät — ohne Cloud, ohne Server