Open-Source-KI lokal nutzen: Modelle, Software und Hardware
Lokale Open-Source-KI ohne Vorwissen: Verstehe Modelle, Apps und Speicher, teste passende Software und finde mit zwei interaktiven Beratern ein sinnvolles Setup.
In diesem Artikel
Artikel
- Lesezeit
- 11 Min. Lesezeit
- Veröffentlicht
- Format
- Einsteiger-Guide
- Niveau
- Einsteiger
- Thema
- Datenschutz
Wenn du ChatGPT, Claude oder Gemini nutzt, arbeitet das KI-Modell normalerweise in einem Rechenzentrum. Deine Eingabe wird über das Internet an den Anbieter geschickt und die Antwort kommt von dort zurück. Bei lokaler KI läuft das Modell dagegen auf deinem eigenen Notebook, PC oder Mac. Nach dem Download können viele Modelle auch ohne Internetverbindung antworten.
Dafür musst du keine eigene KI trainieren. Du lädst eine fertige Modelldatei und eine passende App herunter – ähnlich wie eine Musikdatei und einen Player. Entscheidend ist vor allem, ob das Modell in den verfügbaren Speicher passt.
Dieser Einsteiger-Guide führt dich ohne Vorwissen vom ersten Verständnis bis zu einem sinnvollen Test. Du erfährst, welche App du wählen kannst, welche Modelle zu deinem Gerät passen und wann sich neue Hardware überhaupt lohnt. Zwei interaktive Berater helfen dir dabei, dein Budget oder deinen vorhandenen Computer einzuordnen. Alle konkreten Modell- und Hardwareangaben entsprechen dem Stand vom 24. Juli 2026.
Kurzfassung
- Probiere zuerst dein vorhandenes Gerät aus. Kleine Modelle sind auf vielen neueren Computern bereits nützlich.
- Der Speicher ist meist die wichtigste Grenze. Bis 8 GB eignen sich kleine Modelle zum Testen, 16 GB ermöglichen einen soliden Einzelplatz und 24 bis 32 GB deutlich stärkere Modelle.
- Ollama, LM Studio und Jan bieten einen einfachen Start. Ollama hat auf macOS und Windows inzwischen eine besonders zugängliche Chat-App und kann später trotzdem als lokale Schnittstelle für andere Programme dienen.
- Frei herunterladbar bedeutet nicht automatisch vollständig Open Source. Prüfe Modellkarte und Lizenz.
- Lokaler Betrieb kann mehr Kontrolle geben, ist aber keine automatische Datenschutzgarantie. Auch die App, Einstellungen und der konkrete Einsatzzweck zählen.
Lokale KI besteht aus drei einfachen Teilen
Produktnamen und Abkürzungen wirken zunächst kompliziert. Für den Anfang reichen drei Bausteine:
| Baustein | Einfach erklärt | Beispiele |
|---|---|---|
| Modell | Die heruntergeladene Datei mit den gelernten Fähigkeiten der KI. | Gemma, Qwen oder gpt-oss |
| App | Das Programm, mit dem du das Modell lädst, Einstellungen auswählst und chattest. | LM Studio, Jan oder Ollama |
| Hardware | Dein Computer mit Prozessor, Grafikeinheit und verfügbarem Speicher. | Windows-PC, Mac oder Linux-Rechner |
Im Hintergrund verwendet die App eine technische Laufzeit, die die Modelldatei berechnet. Namen wie llama.cpp oder MLX begegnen dir deshalb häufig. Für einen ersten Chat musst du diese Ebene aber nicht selbst konfigurieren: Einsteigerfreundliche Apps bringen eine passende Laufzeit bereits mit.
„Lokal“, „kostenlos“ und „Open Source“ sind nicht dasselbe
Lokal beschreibt nur, wo gerechnet wird. Ein lokales Modell kann kostenlos oder kostenpflichtig, offen oder proprietär sein. Auch eine App kann offene Modelle ausführen, ohne selbst Open Source zu sein. LM Studio ist beispielsweise eine proprietäre Desktop-App; Jan und Ollama stellen wesentliche Komponenten als Open-Source-Software bereit.
Viele frei herunterladbare Modelle sind genauer gesagt Open Weights: Die fertigen Modellgewichte sind verfügbar, aber Trainingsdaten und Entstehungsprozess nicht vollständig offen. Die strengere Open Source AI Definition der Open Source Initiative verlangt mehr. Für deinen ersten lokalen Test ist diese Unterscheidung kein Hindernis. Für berufliche Nutzung solltest du jedoch immer die konkrete Lizenz und Modellkarte prüfen.
Wann sich lokale KI lohnt – und wann die Cloud einfacher ist
Lokale KI ist kein automatischer Ersatz für ChatGPT und andere Cloud-Dienste. Sie ist besonders interessant, wenn Kontrolle, Offline-Nutzung oder eine feste lokale Integration wichtiger sind als die absolut beste verfügbare Modellleistung.
| Lokale KI passt gut, wenn … | Eine Cloud-Lösung passt oft besser, wenn … |
|---|---|
| du regelmäßig mit lokalen Entwürfen oder Dokumenten arbeitest. | du KI nur gelegentlich nutzt und keine Technik pflegen möchtest. |
| du auch ohne Internet arbeiten möchtest. | du Websuche, sehr große Modelle oder neue Funktionen sofort brauchst. |
| du ein bestimmtes Modell unabhängig betreiben oder in eigene Abläufe einbinden möchtest. | dein Gerät wenig Speicher hat oder schnelle Antworten wichtiger sind als lokaler Betrieb. |
| du bereit bist, Installation, Updates und Sicherheit selbst zu übernehmen. | du dafür möglichst wenig Zeit aufwenden möchtest. |
Nach dem Kauf entstehen zwar keine Gebühren pro Texteingabe. Kostenlos ist ein lokales System trotzdem nicht: Hardware, Strom, SSD-Speicher, Wartung und Arbeitszeit gehören zur Rechnung. Für wenige Stunden Nutzung im Monat ist ein Cloud-Dienst häufig günstiger. Ein sinnvoller Mittelweg kann sein, freigegebene lokale Modelle für geeignete Aufgaben und einen Cloud-Dienst für besonders anspruchsvolle Anfragen zu verwenden.
Die wichtigste Hardware-Regel: Das Modell muss in den Speicher passen
Stell dir den Speicher deines Computers wie eine Arbeitsfläche vor. Die SSD ist der Aktenschrank, in dem die Modelldatei dauerhaft liegt. Bevor die KI antworten kann, muss das Modell auf eine schnellere Arbeitsfläche geladen werden. Ist dort zu wenig Platz, werden Teile ausgelagert. Das funktioniert oft, macht die Antwort aber deutlich langsamer.
- RAM ist der allgemeine Arbeitsspeicher des Computers. Betriebssystem und andere Programme nutzen ihn ebenfalls.
- VRAM ist der besonders schnelle Speicher einer separaten Grafikkarte. Bei klassischen KI-PCs ist er häufig die wichtigste Grenze.
- Gemeinsamer Speicher bei Apple Silicon wird von Prozessor und Grafikeinheit geteilt. Dadurch sind Konfigurationen mit viel nutzbarem Modellspeicher möglich.
VRAM und RAM darfst du nicht einfach zu einem einzigen schnellen Speicher addieren. Eine App kann zwar Teile eines Modells auf beide Bereiche verteilen, doch der Datenaustausch kostet Geschwindigkeit. Für den Einstieg ist ein kleineres Modell, das vollständig in den schnellen Speicher passt, meist angenehmer.
Was bedeuten 7B, 12B oder 27B?
Das „B“ steht für billion, also Milliarden. Ein 12B-Modell besitzt ungefähr zwölf Milliarden gelernte Zahlenwerte, die Parameter genannt werden. Mehr Parameter können mehr Fähigkeiten ermöglichen, garantieren aber nicht automatisch eine bessere Antwort. Ein aktuelles kleines Modell kann bei einer konkreten Aufgabe besser sein als ein älteres großes Modell.
Q4 macht große Modelle kleiner
Bei der Quantisierung werden die Modellgewichte kontrolliert vereinfacht. Dadurch sinkt der Speicherbedarf. Varianten mit „Q4“ im Namen sind für lokale Tests häufig ein guter Ausgangspunkt: deutlich kleiner als die Originaldatei, aber meist noch mit brauchbarer Qualität.
Als grobe Orientierung benötigt ein Q4-Modell etwa 0,56 GB pro Milliarde Parameter. Ein 12B-Modell kommt damit für die reinen Gewichte auf ungefähr 6,7 GB. Zusätzlich brauchen Unterhaltung, Dokumente, Bilder, App und Betriebssystem Speicher. Plane deshalb 20 bis 30 Prozent Reserve ein und wähle nicht die größte Datei, die gerade noch geladen werden kann. Bei Gemma 4 kannst du den Speicherbedarf der einzelnen Varianten direkt vergleichen.
Welche Hardwareklasse ist ein sinnvoller Start?
Preise und einzelne Grafikkarten ändern sich schnell. Eine langlebigere Entscheidung beginnt deshalb mit der Speichermenge und deinen Aufgaben.
| Ausgangspunkt | Realistische Modellklasse | Geeignet für |
|---|---|---|
| Vorhandener Computer mit 16 GB RAM oder bis 8 GB VRAM | 2B bis etwa 8B in Q4 | Ausprobieren, einfache Texte, Zusammenfassungen und kleine Extraktionen |
| Neuer KI-PC mit 16 GB VRAM und 32 GB RAM | 9B bis 14B komfortabel; ausgewählte größere Modelle | Regelmäßiger Einzelplatz für Schreiben, Dokumente und Codehilfe |
| Leistungsstarker PC mit 24 bis 32 GB VRAM und 64 GB RAM | 27B bis 35B in Q4 | Anspruchsvollere Fachaufgaben, Coding und multimodale Modelle |
| Apple Silicon mit 48 bis 128 GB gemeinsamem Speicher | 27B bis 35B mit viel Reserve; auf größeren Konfigurationen ausgewählte 70B-Varianten | Leiser Arbeitsplatz mit hoher Speicherkapazität |
Der beste erste Schritt ist fast immer das vorhandene Gerät. Mit Gemma 4 E4B, Qwen3.5-2B oder einem kompakten 8B-Modell erkennst du schnell, ob deine Aufgaben lokal funktionieren. Eine reine CPU-Ausführung ist langsamer als eine gute GPU, reicht aber für einen ersten Versuch.
Für einen gezielten Neukauf sind 16 GB VRAM eine vernünftige Einstiegsklasse. Bei einer RTX 5060 Ti ist die 16-GB-Version für lokale Modelle klar sinnvoller als die 8-GB-Variante. Eine schnellere Grafikkarte mit derselben Speichermenge berechnet Antworten zwar schneller, kann aber nicht automatisch größere Modelle laden.
24 bis 32 GB bieten deutlich mehr Auswahl. Eine gebrauchte RTX 3090 stellt 24 GB bereit, benötigt aber viel Platz, Strom und Kühlung. Die RTX 5090 mit 32 GB ist eine teure Hochleistungsoption und kein notwendiger Standardkauf. Eine Radeon RX 7900 XTX bietet ebenfalls 24 GB; prüfe hier vor dem Kauf die Kompatibilität deines genauen Betriebssystem- und Software-Setups.
Apple-Systeme verwenden gemeinsamen Speicher. Ein Mac mini mit M4 Pro kann mit 48 oder 64 GB konfiguriert werden, der Mac Studio reicht noch höher. Das ist attraktiv für große Modelle in einem leisen System. Prüfe aber vorher, ob deine gewünschte Software Apple Silicon unterstützt oder nur mit NVIDIA-Grafikkarten funktioniert.
Interaktiver Setup-Berater
Welches lokale KI-Setup passt zu deinem Budget?
Gib deinen Budgetrahmen ein und entscheide, ob du ein komplettes System oder ein Upgrade suchst. Du erhältst bis zu drei realistische Ausgangspunkte für den Vergleich.
Wichtig: Die Vorschläge sind Ausgangspunkte, keine Kaufempfehlung oder Zusage zur Kompatibilität. Grundlage sind platzsparend komprimierte Modelle, eine gleichzeitige Nutzung und keine sehr langen Chats, Dokumente oder Bildserien. Prüfe vor Kauf oder beruflicher Nutzung aktuelle Preise, Systemanforderungen, Modelllizenz und Datenschutz. Stand: 24. Juli 2026.
Vor einem Hardwarekauf prüfen
- Welche zwei oder drei echten Aufgaben soll die lokale KI lösen?
- Welche Modellklasse reicht dafür wahrscheinlich aus?
- Bleiben nach dem Laden mindestens 20 bis 30 Prozent Speicherreserve?
- Unterstützt die gewünschte App genau diese Hardware und dieses Betriebssystem?
- Ist ein Cloud-Dienst bei nur gelegentlicher Nutzung günstiger und einfacher?
Welche Software solltest du als Einsteiger wählen?
Du musst nicht mehrere Programme gleichzeitig installieren. Wähle zuerst einen einfachen Weg und wechsle nur, wenn dir später eine Funktion fehlt.
| Software | Guter Einsatz | Einordnung |
|---|---|---|
| Ollama | Auf macOS und Windows Modelle direkt in einer übersichtlichen App laden, chatten sowie Texte, PDFs und passende Bilder verwenden | Sehr einfacher Start mit einer später weiterhin nutzbaren lokalen Schnittstelle; unter Linux steht die Bedienung über das Terminal im Vordergrund |
| LM Studio | Modelle suchen, vergleichen und mit detaillierteren Einstellungen in einer Desktop-App testen | Zugängliche Oberfläche mit viel Kontrolle; App selbst ist proprietär |
| Jan | Lokaler Chat in einer offenen Desktop-App | Gute Wahl, wenn auch die Oberfläche Open Source sein soll |
| llama.cpp | Viele Hardwaretypen und GGUF-Dateien mit genauer Kontrolle ausführen | Leistungsfähig, aber eher der nächste Schritt als der erste |
Unsere Standardempfehlung: Auf macOS und Windows ist Ollama inzwischen einer der einfachsten Wege zum ersten lokalen Chat. LM Studio eignet sich besonders, wenn du Modelle und Einstellungen genauer vergleichen möchtest. Wenn dir eine vollständig offene Desktop-Oberfläche wichtig ist, nimm Jan. Ollama bleibt zugleich interessant, sobald später ein Schreibprogramm, Skript oder Entwicklungswerkzeug auf dein lokales Modell zugreifen soll.
Dein erster lokaler Test in vier Schritten
- Installiere Ollama, LM Studio oder Jan von der offiziellen Website.
- Starte mit einem kleinen Modell. Wähle eine offizielle oder klar verlinkte Q4-Variante, die sicher in deinen Speicher passt.
- Teste drei eigene Aufgaben: einen Text zusammenfassen, Informationen strukturiert extrahieren und eine typische Frage aus deinem Alltag beantworten.
- Beobachte Qualität und Geschwindigkeit. Kaufe erst neue Hardware, wenn du genau benennen kannst, was mit dem kleinen Modell nicht gut genug funktioniert.
Eine ausführlichere Anleitung für LM Studio sowie die Einordnung von Offline-Modus und Dokumenten-Chat findest du in unserem Guide „Lokale KI-Chatbots: Tools, Datenschutz und Grenzen“. Prüfe in jeder App außerdem, ob wirklich ein lokales Modell ausgewählt ist. Modellsuche, Downloads, Updates, Websuche oder optionale Cloud-Anbieter können weiterhin Internetzugriff verwenden.
Schritt-für-Schritt-Anleitungen für die drei Apps
- Ollama installieren und das erste lokale Modell starten
- LM Studio installieren, ein Modell laden und lokal chatten
- Jan installieren und lokale Modelle in der offenen Desktop-App nutzen
Welche aktuellen Modelle passen zu deinem Gerät?
Es gibt keine Modellfamilie, die für jede Aufgabe am besten ist. Benchmarks veralten und bilden deutsche Texte oder deinen Arbeitsalltag nur teilweise ab. Nutze Modellnamen deshalb als Startpunkt, nicht als ewige Bestenliste.
Ein multimodales Modell kann neben Text auch Bilder und je nach Modell weitere Medien wie Audio verarbeiten. Wenn du nur schreiben, zusammenfassen oder Informationen extrahieren möchtest, brauchst du diese Zusatzfunktion nicht zwingend.
Interaktiver Modell-Berater
Welche offenen Modelle passen zu deinem Gerät?
Trage Hardware und Speicher deines Rechners ein. Du bekommst eine vorsichtige Auswahl aktueller Modelle, mit denen sich der lokale Einstieg lohnt.
Wichtig: Die Vorschläge sind Ausgangspunkte, keine Kaufempfehlung oder Zusage zur Kompatibilität. Grundlage sind platzsparend komprimierte Modelle, eine gleichzeitige Nutzung und keine sehr langen Chats, Dokumente oder Bildserien. Prüfe vor Kauf oder beruflicher Nutzung aktuelle Preise, Systemanforderungen, Modelllizenz und Datenschutz. Stand: 24. Juli 2026.
| Verfügbarer Speicher | Gute erste Kandidaten | Wofür sie sich eignen |
|---|---|---|
| Bis etwa 8 GB | Gemma 4 E4B, Qwen3.5-2B, Ministral 3 3B | Erste Tests, kurze Zusammenfassungen, Umformulierung und Datenextraktion |
| Um 16 GB | Gemma 4 12B, Qwen3.5-9B, gpt-oss-20b | Vielseitiger Einzelplatz; Gemma und Qwen auch für multimodale Aufgaben, gpt-oss für Text und Schlussfolgern |
| 24 bis 32 GB | Qwen3.6-27B, Qwen3.6-35B-A3B, Gemma 4 26B-A4B oder 31B | Anspruchsvollere Fachaufgaben, Coding und mehr Qualitätsreserve |
Beginne auch auf leistungsfähiger Hardware mit einem kleineren Vergleichsmodell. Wenn ein 9B-Modell deine Dokumente zuverlässig strukturiert, ist ein 35B-Modell für diese Aufgabe möglicherweise nur langsamer und teurer.
Vor dem Download kurz prüfen
- Herkunft: Stammt das Basismodell aus dem offiziellen Organisationskonto und verweist die Quantisierung eindeutig darauf?
- Modellkarte: Sind Sprachen, vorgesehene Aufgaben und bekannte Grenzen beschrieben?
- Format: Für LM Studio, Jan und llama.cpp sind GGUF-Dateien besonders praktisch.
- Lizenz: Ist dein privater, beruflicher oder kommerzieller Zweck erlaubt?
Modelle mit echten Aufgaben vergleichen
Eine schnelle Antwort ist nicht automatisch eine gute Antwort. Verwende für zwei oder drei Modelle dieselben eigenen Aufgaben und denselben Ausgangstext. So erkennst du, ob ein größeres Modell in deinem Alltag tatsächlich einen Vorteil bringt.
Arbeite ausschließlich mit dem Text zwischen <quelle> und </quelle>. 1. Fasse die drei wichtigsten Aussagen in klarer deutscher Sprache zusammen. 2. Nenne zwei Aussagen, die sich aus der Quelle nicht sicher beantworten lassen. 3. Extrahiere alle genannten Zahlen mit ihrem Kontext als Tabelle. 4. Formuliere eine vorsichtige Handlungsempfehlung. 5. Trenne belegte Informationen deutlich von deiner Interpretation. <quelle> [Text hier einfügen] </quelle>
Bewerte anschließend vier Punkte: Wurden Aufgabe und Format eingehalten? Sind die Aussagen korrekt aus der Quelle abgeleitet? Wie lange dauert die Antwort? Und passt das Ergebnis zu Lizenz, Datenschutz und deinem tatsächlichen Ablauf? Bewahre mindestens ein kleineres Modell als Vergleich auf.
Datenschutz und Sicherheit: lokal ist ein Vorteil, kein Freifahrtschein
Lokale Verarbeitung kann verhindern, dass jede Eingabe an einen externen KI-Anbieter übertragen wird. Das ist ein echter Vorteil. Trotzdem können App, Websuche, Telemetrie, Cloud-Backups oder verbundene Dienste weiterhin Daten übertragen. Auch lokale Modelle können falsche Informationen erzeugen.
Sicherer privater Start
- Lade Apps und Modelle aus nachvollziehbaren Quellen.
- Halte Betriebssystem, App und Laufzeit aktuell.
- Prüfe, ob Cloud-Modelle, Websuche oder Telemetrie aktiviert sind.
- Schütze Gerät, Chatverläufe und Dokumentenordner mit sicheren Konten und Verschlüsselung.
- Überprüfe wichtige Aussagen weiterhin anhand verlässlicher Quellen.
Auch bei lokal betriebener KI bleiben die üblichen Datenschutzanforderungen bestehen. Für berufliche Nutzung kommen deshalb Fragen zu Rechtsgrundlage und Zweck, zulässigen Datenklassen, Rollen und Zugriffsrechten, Löschung, Backups, Lizenzen und möglichen Pflichten nach dem AI Act hinzu.
Wenn ein Modell automatisch Dokumente, Webseiten oder E-Mails verarbeitet und anschließend Aktionen ausführen darf, steigt das Risiko. Das Bundesamt für Sicherheit in der Informationstechnik warnt vor indirekten Prompt Injections: Manipulierte Anweisungen in fremden Inhalten können ein verbundenes Modell zu unerwünschten Aktionen verleiten. Solche Integrationen sollten nur mit minimalen Rechten und menschlicher Bestätigung arbeiten.
Sechs typische Fehler beim Einstieg
- Hardware kaufen, bevor eine echte Aufgabe getestet wurde.
- Nur auf die Geschwindigkeit einer Grafikkarte schauen und den VRAM übersehen.
- Das größte gerade noch passende Modell laden und keinen Speicher für Kontext lassen.
- Ein großes Modell automatisch für besser halten.
- Eine optionale Cloud-Funktion mit lokalem Betrieb verwechseln.
- Lizenz, Modellkarte, Updates und Datensicherung ignorieren.
Fazit: klein anfangen und erst nach dem Test kaufen
Der beste Einstieg in lokale offene KI beginnt nicht mit der teuersten Grafikkarte. Installiere eine zugängliche App, lade ein kleines Q4-Modell und teste drei Aufgaben aus deinem Alltag. Erst wenn Qualität oder Geschwindigkeit konkret nicht ausreichen, entscheidest du über ein größeres Modell oder neue Hardware.
Für einen neuen KI-PC sind 16 GB VRAM ein vernünftiger Einstieg; 24 bis 32 GB eröffnen deutlich stärkere Modellklassen. Viele Menschen brauchen diese Leistung jedoch nicht. Das kleinste Modell, das eine Aufgabe zuverlässig löst, ist meist die günstigere, schnellere und nachhaltigere Wahl.