Stell dir vor, deine KI läuft nur auf deinem eigenen Rechner, ohne Login, ohne Abo und ohne dass Daten irgendwo in die USA fliegen.
Genau das ist lokale KI. Sie ist einfacher, als du denkst, aber auch nicht die Wunderwaffe, als die sie oft verkauft wird.
In diesem Guide zeige ich dir, was lokale KI wirklich kann, welche Möglichkeiten und Kosten dahinterstecken und wie du in wenigen Schritten dein erstes eigenes Modell startest.
Kurz vorweg noch eine Klarstellung zum Sprachgebrauch. Mit „KI" meine ich in diesem Artikel fast durchgehend Sprachmodelle, also LLMs wie Llama oder Mistral, weil der Begriff im Alltag inzwischen meist so verwendet wird. Tatsächlich ist KI als Forschungsfeld deutlich breiter und umfasst auch Bilderkennung, Robotik oder klassische Empfehlungssysteme. Für lokale Installationen im Unternehmen sind in der Praxis aber fast immer Sprachmodelle gemeint, deshalb bleibe ich der Einfachheit halber bei „KI".
1. Was ist lokale KI?
Lokale KI heißt im Kern, dass ein KI-Modell nicht bei einem großen Cloud-Anbieter wie OpenAI oder Anthropic läuft, sondern unter deiner eigenen Kontrolle, offline nutzbar und ohne dass ein fremdes Unternehmen mitliest.
In der Praxis wird der Begriff aber unterschiedlich benutzt. Manche meinen damit ein Modell auf dem eigenen Rechner, andere ein gemietetes System bei einem europäischen Anbieter. Im nächsten Kapitel räume ich das kurz auf.
Nur so viel vorab: Viele Modelle, die du dafür herunterlädst, wie Llama von Meta, gelten offiziell nicht als echtes Open Source, sondern nur als offene Gewichte. Für die Praxis spielt das selten eine Rolle, wichtig wird es erst bei der Lizenzfrage in Kapitel 10.
2. Welche Arten von KI-Hosting gibt es?
Bevor es weitergeht, lohnt sich eine kurze Einordnung, denn „lokale KI" ist eigentlich ein Sammelbegriff für zwei sehr unterschiedliche Wege. Insgesamt unterscheidet man drei Modelle, wie Unternehmen KI einsetzen.
Cloud-KI (SaaS). Du nutzt einen fertigen Dienst wie ChatGPT, Claude oder Gemini über Browser oder API. Der Anbieter betreibt alles, du hast keinen Einfluss darauf, wo und wie deine Daten verarbeitet werden, und zahlst meist pro Nutzer oder pro Anfrage. Auch europäische Managed-Plattformen wie der IONOS AI Model Hub oder Azure gehören strenggenommen hierher, denn auch dort betreibt der Anbieter das Modell für dich. Der Unterschied: Sie hosten offene Modelle in EU-Rechenzentren und geben dir dadurch mehr Datenkontrolle als ChatGPT & Co.
Self-Hosted KI. Du mietest reine Rechenleistung, zum Beispiel einen GPU-Server bei Hetzner, und installierst und betreibst das Modell dort selbst. Deine Daten bleiben komplett unter deiner Kontrolle, die Hardware gehört dir trotzdem nicht.
On-Premise KI. Das Modell läuft auf deiner eigenen Hardware, physisch bei dir im Büro oder Serverraum. Volle Kontrolle, volle Verantwortung, und die einzige Variante, die auch ganz ohne Internetverbindung funktioniert.
Im allgemeinen Sprachgebrauch und in der Suche meinen die meisten mit „lokaler KI" On-Premise, und genau darum geht es in diesem Guide hauptsächlich. Viele Vorteile aus dem nächsten Kapitel gelten aber genauso für Self-Hosted, deshalb schauen wir uns beide Wege an.

So sieht Self-Hosted in der Praxis aus
Willst du kein eigenes Gerät kaufen, ist Self-Hosted dein Weg. Der deutsche Anbieter Hetzner vermietet GPU-Server ab etwa 200 Euro im Monat für den Einstieg, größere Konfigurationen können aber schnell mal 1000 Euro monatlich überschreiten. Die Installation läuft danach genauso wie bei eigener Hardware, nur eben auf einem gemieteten Server statt im eigenen Büro.
Willst du dir auch das Installieren und Betreiben sparen, bist du eigentlich schon bei Cloud-KI, nur eben bei der europäischen, offenen Variante wie dem IONOS AI Model Hub. Dort läuft das Modell, zum Beispiel Llama 3.3 oder das deutsche Teuken-7B, komplett in deutschen Rechenzentren, und du zahlst nur pro genutzten Token, ohne dich um Hardware oder Installation zu kümmern.
Der Haken an Self-Hosted: Du bist wieder von einem Anbieter abhängig, auch wenn der diesmal in Deutschland oder der EU sitzt und nicht in Kalifornien.
3. Warum lokale KI
Es gibt vier gute Gründe, warum sich Unternehmen für On-Premise oder Self-Hosted KI entscheiden, statt bei ChatGPT & Co. zu bleiben.
Datenschutz. Kein Byte verlässt deinen Rechner, weder Kundendaten noch interne Dokumente oder Preise. Kein US-Anbieter, der irgendwo mitliest.
Lokale KI ohne Internet. Sobald das Modell heruntergeladen ist, brauchst du keine Verbindung mehr, egal ob auf der Baustelle, im Zug oder im Serverraum ohne WLAN.
Keine Abo-Falle. Du zahlst einmal für die Hardware, danach kostet dich jede Anfrage nur noch Strom statt eines monatlichen Abos, das mit mehr Nutzern automatisch teurer wird.
DSGVO. Sobald Daten dein System nicht verlassen, wird die Sache einfach, denn es gibt keinen Auftragsverarbeitungsvertrag mit einem US-Anbieter und keine Grauzone bei Cloud-Diensten außerhalb der EU.
4. Was lokale KI wirklich kostet
Am Beispiel On-Premise wird die Rechnung am deutlichsten, denn hier trägst du die Kosten komplett selbst. Die Anschaffung ist dabei nur ein Teil. Für eine Grafikkarte mit 24 GB Grafikspeicher oder mehr zahlst du grob 1.000 bis 4.000 Euro, ein passender Mac mit viel Unified Memory bewegt sich in einer ähnlichen Größenordnung.
Dazu kommt der Strom. Rechne mit rund 27 Cent pro Kilowattstunde in Deutschland, eine Grafikkarte wie die RTX 4090 zieht unter Volllast 300 bis 450 Watt. Bei ein paar Stunden Nutzung täglich landest du bei wenigen Euro im Monat.
Was in den meisten Rechnungen fehlt, ist die Ineffizienz einer einzelnen Grafikkarte. Ein Rechenzentrum verarbeitet hunderte Anfragen gleichzeitig über dieselbe Hardware und teilt sich die Kosten pro Anfrage mit vielen Kunden, während deine Grafikkarte im Büro meist nur für dich rechnet und dabei einen Großteil ihrer Leistung ungenutzt lässt.
Und dann ist da noch die Wartung. Alle paar Monate erscheinen neue, bessere Modelle, und willst du mithalten, lädst du regelmäßig neu herunter und testest neu. Treiber müssen aktuell bleiben, die App braucht Updates, und läuft etwas nicht, bist du dein eigener Support.

Für gelegentliche Nutzung ist ein Cloud-Abo für 20 Euro im Monat oft günstiger, als eine eigene Grafikkarte zu betreiben. Lokale KI rechnet sich vor allem bei hohem, dauerhaftem Nutzungsvolumen oder wenn dir Datenkontrolle wichtiger ist als der letzte Cent.
5. Was lokale KI (noch) nicht kann
Lokale Modelle sind schwächer. GPT-5 oder Claude laufen auf riesigen Rechenzentren, dein PC zuhause nicht, und ein Modell auf deiner Grafikkarte ist kleiner und damit auch weniger klug als das große Cloud-Modell.
Kein Wissen von heute. Ein lokales Modell kennt nur das, was bis zu seinem Trainingsstichtag bekannt war, und kann nicht einfach im Internet nachschauen, was gestern passiert ist. Willst du das, musst du es selbst anbinden.
Einarbeitung nötig. Du wählst dein Modell selbst, richtest die App ein und findest heraus, was deine Hardware stemmt, das ist kein „Account erstellen, loslegen" wie bei ChatGPT.
6. Wie viel Hardware braucht man
Dieses Kapitel und das nächste zu den Programmen drehen sich um den On-Premise-Weg, also um eigene Hardware.
Die wichtigste Frage bei jedem PC für lokale KI ist, wie viel Grafikspeicher, kurz VRAM, deine Grafikkarte hat. Nicht die CPU und nicht der Arbeitsspeicher entscheiden, sondern der VRAM, denn er bestimmt, ob ein Modell überhaupt lädt.
Modelle gibt es meist in mehreren komprimierten Varianten, sogenannten Quantisierungen. Die gängigste heißt Q4 und ist für fast alle Anwendungsfälle die richtige Wahl, sie spart viel Speicher bei kaum spürbarem Qualitätsverlust. In der App siehst du beim Download meist mehrere Q4-Varianten, im Zweifel reicht die vorausgewählte Option völlig aus.
Die Speicher-Stufen im Überblick
| VRAM | Was du fahren kannst |
|---|---|
| 8 GB | Kleine Modelle bis ca. 8 Milliarden Parameter |
| 16 GB | Modelle bis ca. 14 Milliarden Parameter, oder kleinere Modelle in besserer Qualität |
| 24 GB | Modelle bis ca. 32 Milliarden Parameter |
| 32 GB+ | Große Modelle ab 32 Milliarden Parameter, teils in höherer Qualität |
Bei Apple-Rechnern mit M-Chip liegt die Sache etwas anders, weil sich CPU und GPU denselben Arbeitsspeicher teilen, den sogenannten Unified Memory. Ein Mac mini mit 16 GB Unified Memory stemmt damit Modelle bis etwa 24 Milliarden Parameter, und für ernsthafte, dauerhafte Nutzung gelten 32 GB als guter Einstieg. Wichtig ist dabei auch die Speicherbandbreite, also wie schnell die Daten gelesen werden, denn ein M3 Max mit rund 400 GB/s generiert spürbar schneller Text als ein M4 Pro mit rund 273 GB/s, selbst beim exakt gleichen Modell.
7. Die Programme im Vergleich
Du brauchst eine App, die das Modell lädt und dir eine Oberfläche zum Chatten gibt. Hier die wichtigsten vier für Text, plus eine für Bilder.
| Programm | Am besten für | Kurz gesagt |
|---|---|---|
| LM Studio | Einsteiger | Übersichtliche Oberfläche, eingebaute Modellsuche, aktuell die ausgereifteste App am Markt |
| Ollama | Entwickler | Läuft übers Terminal, stellt eine API bereit, perfekt für eigene Automatisierungen |
| Jan.ai | Datenschutz-Puristen | Komplett offline, komplett quelloffen, jede Zeile Code einsehbar |
| ComfyUI | Bildgenerierung | Node-basiert für Stable Diffusion & Co., mächtig, aber mit Lernkurve |
Für den Start reicht LM Studio fast immer. Such dir ein Modell direkt in der App, klick auf Download, fertig.

Erst wenn du eigene Workflows bauen willst, etwa in n8n, lohnt sich der Umstieg auf Ollama.
Für Bilder statt Text ist ComfyUI die richtige Wahl, dafür solltest du aber mindestens 6 GB, besser 12 GB VRAM mitbringen.
8. Woher du Modelle bekommst und welche sich lohnen
Die zentrale Anlaufstelle für lokale KI-Modelle heißt Hugging Face. Dort laden Forschungsteams und Unternehmen ihre Modelle hoch, mit Beschreibung, Lizenz und oft auch Nutzerbewertungen.
Du musst aber gar nicht selbst suchen. LM Studio, Ollama und Jan.ai haben alle eine eingebaute Modellsuche. Du tippst einen Namen, die App zeigt dir passende Größen und Quantisierungsstufen, und du klickst auf Download.
Welche lokalen KI-Modelle sich aktuell lohnen
| Modell | Größe | Braucht ungefähr | Gut für |
|---|---|---|---|
| Qwen3 | 8B / 14B | 8–16 GB | Allrounder, gutes Deutsch, guter Einstieg |
| Llama 3.3 | 8B / 70B | 8 GB bzw. 40 GB+ | Etablierter Allrounder, große Community |
| Mistral Small | ca. 24B | 16–24 GB | Solide Alternative, oft freizügigere Lizenz |
| Gemma 3 | 4B–27B | ab 6 GB | Läuft besonders gut auf dem Mac |
| Teuken-7B | 7B | ab 6 GB | Made in Germany, wirklich offene Lizenz, starkes Deutsch |
Als Einstieg für Text auf Deutsch eignet sich Qwen3 in 8B oder 14B am besten. Es läuft auf Mittelklasse-Hardware und liefert für die meisten Alltagsaufgaben gute Ergebnisse.
Willst du bewusst ein Modell mit deutschen Wurzeln und einer wirklich offenen Lizenz, schau dir Teuken-7B an. Entwickelt von Fraunhofer und Partnern, mittlerweile auch kommerziell nutzbar über die Telekom oder direkt über den IONOS AI Model Hub.
9. Installation: In drei Schritten startklar
So installierst du On-Premise-KI in unter 15 Minuten. Nutzt du stattdessen Self-Hosted über den IONOS AI Model Hub oder einen ähnlichen Dienst, entfällt dieser Schritt, dort loggst du dich einfach ein und wählst dein Modell.
Schritt 1: Programm installieren
Lade LM Studio von der offiziellen Seite herunter und installiere es wie jede andere App. Windows, Mac und Linux werden unterstützt.
Schritt 2: Das richtige Modell wählen
Öffne die Modellsuche in LM Studio und orientiere dich an deinem VRAM aus Kapitel 6. Hast du zum Beispiel 8 GB, wähle ein 7B- oder 8B-Modell. Klick auf Download und warte, bis die Datei fertig geladen ist.

LLM Studio zeigt dir auch direkt an wenn ein Modell womöglich zu groß für deine Maschine ist.

Schritt 3: Der erste Test
Lade das Modell im Chat-Fenster, stell eine einfache Frage und achte auf zwei Dinge: wie schnell das Modell antwortet und wie gut die Antwort ist. Beides zusammen sagt dir, ob dein Setup passt oder ob du ein kleineres Modell brauchst.

10. Darfst du das kommerziell nutzen? Die Lizenzfrage
Nicht jede Lizenz erlaubt dir, ein Modell in deinem Unternehmen einzusetzen, und das ist der Punkt, den die wenigsten vorher prüfen.
Metas Llama-Lizenz zum Beispiel verbietet bestimmte militärische Nutzungen und verlangt eine separate Lizenz von Meta, sobald dein Produkt mehr als 700 Millionen Nutzer im Monat hat. Die Open Source Initiative erkennt die Lizenz deshalb auch nicht als echtes Open Source an, und die Free Software Foundation stuft sie sogar als unfrei ein. Für die allermeisten Unternehmen ist das in der Praxis kein Problem, trotzdem lohnt sich ein Blick ins Kleingedruckte.
Mistral und Qwen veröffentlichen viele Modelle unter der Apache-2.0-Lizenz. Die ist unkompliziert und erlaubt nahezu uneingeschränkte kommerzielle Nutzung ohne versteckte Fallstricke.
Gemma von Google steht dagegen unter einer eigenen Lizenz mit zusätzlichen Nutzungsbedingungen.
Bevor ein Modell produktiv in deinem Unternehmen läuft, schau dir also die Lizenz auf der Modellseite an. Willst du auf Nummer sicher gehen, greif zu Modellen mit Apache-2.0-Lizenz oder zu echten Open-Source-Modellen.
11. Häufige Fragen zu lokaler KI
Läuft das auch auf einem Notebook ohne dedizierte Grafikkarte?
Nur eingeschränkt. Ohne eigene GPU läuft alles über die CPU, das funktioniert, ist aber spürbar langsamer. Ein Mac mit M-Chip ist hier im Vorteil, weil er, wie in Kapitel 6 beschrieben, keine getrennte, kleine Grafikkarte braucht. Auf einem Windows-Notebook solltest du auf eine dedizierte GPU wie eine RTX 4060 oder besser achten.
Kann lokale KI überhaupt im Internet suchen?
Von Haus aus nein. Ein lokales Modell kennt nur das, was es beim Training gelernt hat, und willst du Websuche, musst du sie selbst anbinden, zum Beispiel über ein Automatisierungstool wie n8n oder ein Plugin in deiner App.
Ab wann lohnt sich lokale KI für mich?
Vor allem dann, wenn du regelmäßig, in großem Volumen oder mit besonders sensiblen Daten arbeitest, bei denen dir Datenkontrolle wichtiger ist als der letzte Cent. Nutzt du KI nur gelegentlich, ist ein normales Cloud-Abo meist die einfachere und günstigere Wahl.