Zum Inhalt springen

Direkt zum richtigen Inhalt

Was möchtest du finden?

Du kannst nach Themen, Tools oder konkreten Fragen suchen.

Open-Source-KI lokal nutzen: Modelle, Software und Hardware

Lokale Open-Source-KI ohne Vorwissen: Verstehe Modelle, Apps und Speicher, teste passende Software und finde mit zwei interaktiven Beratern ein sinnvolles Setup.

In diesem Artikel

Artikel

Lesezeit
11 Min. Lesezeit
Veröffentlicht
Format
Einsteiger-Guide
Niveau
Einsteiger
Thema
Datenschutz

Wenn du ChatGPT, Claude oder Gemini nutzt, arbeitet das KI-Modell normalerweise in einem Rechenzentrum. Deine Eingabe wird über das Internet an den Anbieter geschickt und die Antwort kommt von dort zurück. Bei lokaler KI läuft das Modell dagegen auf deinem eigenen Notebook, PC oder Mac. Nach dem Download können viele Modelle auch ohne Internetverbindung antworten.

Dafür musst du keine eigene KI trainieren. Du lädst eine fertige Modelldatei und eine passende App herunter – ähnlich wie eine Musikdatei und einen Player. Entscheidend ist vor allem, ob das Modell in den verfügbaren Speicher passt.

Dieser Einsteiger-Guide führt dich ohne Vorwissen vom ersten Verständnis bis zu einem sinnvollen Test. Du erfährst, welche App du wählen kannst, welche Modelle zu deinem Gerät passen und wann sich neue Hardware überhaupt lohnt. Zwei interaktive Berater helfen dir dabei, dein Budget oder deinen vorhandenen Computer einzuordnen. Alle konkreten Modell- und Hardwareangaben entsprechen dem Stand vom 24. Juli 2026.

Kurzfassung

  • Probiere zuerst dein vorhandenes Gerät aus. Kleine Modelle sind auf vielen neueren Computern bereits nützlich.
  • Der Speicher ist meist die wichtigste Grenze. Bis 8 GB eignen sich kleine Modelle zum Testen, 16 GB ermöglichen einen soliden Einzelplatz und 24 bis 32 GB deutlich stärkere Modelle.
  • Ollama, LM Studio und Jan bieten einen einfachen Start. Ollama hat auf macOS und Windows inzwischen eine besonders zugängliche Chat-App und kann später trotzdem als lokale Schnittstelle für andere Programme dienen.
  • Frei herunterladbar bedeutet nicht automatisch vollständig Open Source. Prüfe Modellkarte und Lizenz.
  • Lokaler Betrieb kann mehr Kontrolle geben, ist aber keine automatische Datenschutzgarantie. Auch die App, Einstellungen und der konkrete Einsatzzweck zählen.

Lokale KI besteht aus drei einfachen Teilen

Produktnamen und Abkürzungen wirken zunächst kompliziert. Für den Anfang reichen drei Bausteine:

BausteinEinfach erklärtBeispiele
ModellDie heruntergeladene Datei mit den gelernten Fähigkeiten der KI.Gemma, Qwen oder gpt-oss
AppDas Programm, mit dem du das Modell lädst, Einstellungen auswählst und chattest.LM Studio, Jan oder Ollama
HardwareDein Computer mit Prozessor, Grafikeinheit und verfügbarem Speicher.Windows-PC, Mac oder Linux-Rechner

Im Hintergrund verwendet die App eine technische Laufzeit, die die Modelldatei berechnet. Namen wie llama.cpp oder MLX begegnen dir deshalb häufig. Für einen ersten Chat musst du diese Ebene aber nicht selbst konfigurieren: Einsteigerfreundliche Apps bringen eine passende Laufzeit bereits mit.

„Lokal“, „kostenlos“ und „Open Source“ sind nicht dasselbe

Lokal beschreibt nur, wo gerechnet wird. Ein lokales Modell kann kostenlos oder kostenpflichtig, offen oder proprietär sein. Auch eine App kann offene Modelle ausführen, ohne selbst Open Source zu sein. LM Studio ist beispielsweise eine proprietäre Desktop-App; Jan und Ollama stellen wesentliche Komponenten als Open-Source-Software bereit.

Viele frei herunterladbare Modelle sind genauer gesagt Open Weights: Die fertigen Modellgewichte sind verfügbar, aber Trainingsdaten und Entstehungsprozess nicht vollständig offen. Die strengere Open Source AI Definition der Open Source Initiative verlangt mehr. Für deinen ersten lokalen Test ist diese Unterscheidung kein Hindernis. Für berufliche Nutzung solltest du jedoch immer die konkrete Lizenz und Modellkarte prüfen.

Wann sich lokale KI lohnt – und wann die Cloud einfacher ist

Lokale KI ist kein automatischer Ersatz für ChatGPT und andere Cloud-Dienste. Sie ist besonders interessant, wenn Kontrolle, Offline-Nutzung oder eine feste lokale Integration wichtiger sind als die absolut beste verfügbare Modellleistung.

Lokale KI passt gut, wenn …Eine Cloud-Lösung passt oft besser, wenn …
du regelmäßig mit lokalen Entwürfen oder Dokumenten arbeitest.du KI nur gelegentlich nutzt und keine Technik pflegen möchtest.
du auch ohne Internet arbeiten möchtest.du Websuche, sehr große Modelle oder neue Funktionen sofort brauchst.
du ein bestimmtes Modell unabhängig betreiben oder in eigene Abläufe einbinden möchtest.dein Gerät wenig Speicher hat oder schnelle Antworten wichtiger sind als lokaler Betrieb.
du bereit bist, Installation, Updates und Sicherheit selbst zu übernehmen.du dafür möglichst wenig Zeit aufwenden möchtest.

Nach dem Kauf entstehen zwar keine Gebühren pro Texteingabe. Kostenlos ist ein lokales System trotzdem nicht: Hardware, Strom, SSD-Speicher, Wartung und Arbeitszeit gehören zur Rechnung. Für wenige Stunden Nutzung im Monat ist ein Cloud-Dienst häufig günstiger. Ein sinnvoller Mittelweg kann sein, freigegebene lokale Modelle für geeignete Aufgaben und einen Cloud-Dienst für besonders anspruchsvolle Anfragen zu verwenden.

Die wichtigste Hardware-Regel: Das Modell muss in den Speicher passen

Stell dir den Speicher deines Computers wie eine Arbeitsfläche vor. Die SSD ist der Aktenschrank, in dem die Modelldatei dauerhaft liegt. Bevor die KI antworten kann, muss das Modell auf eine schnellere Arbeitsfläche geladen werden. Ist dort zu wenig Platz, werden Teile ausgelagert. Das funktioniert oft, macht die Antwort aber deutlich langsamer.

  • RAM ist der allgemeine Arbeitsspeicher des Computers. Betriebssystem und andere Programme nutzen ihn ebenfalls.
  • VRAM ist der besonders schnelle Speicher einer separaten Grafikkarte. Bei klassischen KI-PCs ist er häufig die wichtigste Grenze.
  • Gemeinsamer Speicher bei Apple Silicon wird von Prozessor und Grafikeinheit geteilt. Dadurch sind Konfigurationen mit viel nutzbarem Modellspeicher möglich.

VRAM und RAM darfst du nicht einfach zu einem einzigen schnellen Speicher addieren. Eine App kann zwar Teile eines Modells auf beide Bereiche verteilen, doch der Datenaustausch kostet Geschwindigkeit. Für den Einstieg ist ein kleineres Modell, das vollständig in den schnellen Speicher passt, meist angenehmer.

Was bedeuten 7B, 12B oder 27B?

Das „B“ steht für billion, also Milliarden. Ein 12B-Modell besitzt ungefähr zwölf Milliarden gelernte Zahlenwerte, die Parameter genannt werden. Mehr Parameter können mehr Fähigkeiten ermöglichen, garantieren aber nicht automatisch eine bessere Antwort. Ein aktuelles kleines Modell kann bei einer konkreten Aufgabe besser sein als ein älteres großes Modell.

Q4 macht große Modelle kleiner

Bei der Quantisierung werden die Modellgewichte kontrolliert vereinfacht. Dadurch sinkt der Speicherbedarf. Varianten mit „Q4“ im Namen sind für lokale Tests häufig ein guter Ausgangspunkt: deutlich kleiner als die Originaldatei, aber meist noch mit brauchbarer Qualität.

Als grobe Orientierung benötigt ein Q4-Modell etwa 0,56 GB pro Milliarde Parameter. Ein 12B-Modell kommt damit für die reinen Gewichte auf ungefähr 6,7 GB. Zusätzlich brauchen Unterhaltung, Dokumente, Bilder, App und Betriebssystem Speicher. Plane deshalb 20 bis 30 Prozent Reserve ein und wähle nicht die größte Datei, die gerade noch geladen werden kann. Bei Gemma 4 kannst du den Speicherbedarf der einzelnen Varianten direkt vergleichen.

Welche Hardwareklasse ist ein sinnvoller Start?

Preise und einzelne Grafikkarten ändern sich schnell. Eine langlebigere Entscheidung beginnt deshalb mit der Speichermenge und deinen Aufgaben.

AusgangspunktRealistische ModellklasseGeeignet für
Vorhandener Computer mit 16 GB RAM oder bis 8 GB VRAM2B bis etwa 8B in Q4Ausprobieren, einfache Texte, Zusammenfassungen und kleine Extraktionen
Neuer KI-PC mit 16 GB VRAM und 32 GB RAM9B bis 14B komfortabel; ausgewählte größere ModelleRegelmäßiger Einzelplatz für Schreiben, Dokumente und Codehilfe
Leistungsstarker PC mit 24 bis 32 GB VRAM und 64 GB RAM27B bis 35B in Q4Anspruchsvollere Fachaufgaben, Coding und multimodale Modelle
Apple Silicon mit 48 bis 128 GB gemeinsamem Speicher27B bis 35B mit viel Reserve; auf größeren Konfigurationen ausgewählte 70B-VariantenLeiser Arbeitsplatz mit hoher Speicherkapazität

Der beste erste Schritt ist fast immer das vorhandene Gerät. Mit Gemma 4 E4B, Qwen3.5-2B oder einem kompakten 8B-Modell erkennst du schnell, ob deine Aufgaben lokal funktionieren. Eine reine CPU-Ausführung ist langsamer als eine gute GPU, reicht aber für einen ersten Versuch.

Für einen gezielten Neukauf sind 16 GB VRAM eine vernünftige Einstiegsklasse. Bei einer RTX 5060 Ti ist die 16-GB-Version für lokale Modelle klar sinnvoller als die 8-GB-Variante. Eine schnellere Grafikkarte mit derselben Speichermenge berechnet Antworten zwar schneller, kann aber nicht automatisch größere Modelle laden.

24 bis 32 GB bieten deutlich mehr Auswahl. Eine gebrauchte RTX 3090 stellt 24 GB bereit, benötigt aber viel Platz, Strom und Kühlung. Die RTX 5090 mit 32 GB ist eine teure Hochleistungsoption und kein notwendiger Standardkauf. Eine Radeon RX 7900 XTX bietet ebenfalls 24 GB; prüfe hier vor dem Kauf die Kompatibilität deines genauen Betriebssystem- und Software-Setups.

Apple-Systeme verwenden gemeinsamen Speicher. Ein Mac mini mit M4 Pro kann mit 48 oder 64 GB konfiguriert werden, der Mac Studio reicht noch höher. Das ist attraktiv für große Modelle in einem leisen System. Prüfe aber vorher, ob deine gewünschte Software Apple Silicon unterstützt oder nur mit NVIDIA-Grafikkarten funktioniert.

Interaktiver Setup-Berater

Welches lokale KI-Setup passt zu deinem Budget?

Gib deinen Budgetrahmen ein und entscheide, ob du ein komplettes System oder ein Upgrade suchst. Du erhältst bis zu drei realistische Ausgangspunkte für den Vergleich.

Was möchtest du?
Bevorzugte Plattform
Zurücksetzen

Wichtig: Die Vorschläge sind Ausgangspunkte, keine Kaufempfehlung oder Zusage zur Kompatibilität. Grundlage sind platzsparend komprimierte Modelle, eine gleichzeitige Nutzung und keine sehr langen Chats, Dokumente oder Bildserien. Prüfe vor Kauf oder beruflicher Nutzung aktuelle Preise, Systemanforderungen, Modelllizenz und Datenschutz. Stand: 24. Juli 2026.

Vor einem Hardwarekauf prüfen

  • Welche zwei oder drei echten Aufgaben soll die lokale KI lösen?
  • Welche Modellklasse reicht dafür wahrscheinlich aus?
  • Bleiben nach dem Laden mindestens 20 bis 30 Prozent Speicherreserve?
  • Unterstützt die gewünschte App genau diese Hardware und dieses Betriebssystem?
  • Ist ein Cloud-Dienst bei nur gelegentlicher Nutzung günstiger und einfacher?

Welche Software solltest du als Einsteiger wählen?

Du musst nicht mehrere Programme gleichzeitig installieren. Wähle zuerst einen einfachen Weg und wechsle nur, wenn dir später eine Funktion fehlt.

SoftwareGuter EinsatzEinordnung
OllamaAuf macOS und Windows Modelle direkt in einer übersichtlichen App laden, chatten sowie Texte, PDFs und passende Bilder verwendenSehr einfacher Start mit einer später weiterhin nutzbaren lokalen Schnittstelle; unter Linux steht die Bedienung über das Terminal im Vordergrund
LM StudioModelle suchen, vergleichen und mit detaillierteren Einstellungen in einer Desktop-App testenZugängliche Oberfläche mit viel Kontrolle; App selbst ist proprietär
JanLokaler Chat in einer offenen Desktop-AppGute Wahl, wenn auch die Oberfläche Open Source sein soll
llama.cppViele Hardwaretypen und GGUF-Dateien mit genauer Kontrolle ausführenLeistungsfähig, aber eher der nächste Schritt als der erste

Unsere Standardempfehlung: Auf macOS und Windows ist Ollama inzwischen einer der einfachsten Wege zum ersten lokalen Chat. LM Studio eignet sich besonders, wenn du Modelle und Einstellungen genauer vergleichen möchtest. Wenn dir eine vollständig offene Desktop-Oberfläche wichtig ist, nimm Jan. Ollama bleibt zugleich interessant, sobald später ein Schreibprogramm, Skript oder Entwicklungswerkzeug auf dein lokales Modell zugreifen soll.

Dein erster lokaler Test in vier Schritten

  1. Installiere Ollama, LM Studio oder Jan von der offiziellen Website.
  2. Starte mit einem kleinen Modell. Wähle eine offizielle oder klar verlinkte Q4-Variante, die sicher in deinen Speicher passt.
  3. Teste drei eigene Aufgaben: einen Text zusammenfassen, Informationen strukturiert extrahieren und eine typische Frage aus deinem Alltag beantworten.
  4. Beobachte Qualität und Geschwindigkeit. Kaufe erst neue Hardware, wenn du genau benennen kannst, was mit dem kleinen Modell nicht gut genug funktioniert.

Eine ausführlichere Anleitung für LM Studio sowie die Einordnung von Offline-Modus und Dokumenten-Chat findest du in unserem Guide „Lokale KI-Chatbots: Tools, Datenschutz und Grenzen“. Prüfe in jeder App außerdem, ob wirklich ein lokales Modell ausgewählt ist. Modellsuche, Downloads, Updates, Websuche oder optionale Cloud-Anbieter können weiterhin Internetzugriff verwenden.

Schritt-für-Schritt-Anleitungen für die drei Apps

Welche aktuellen Modelle passen zu deinem Gerät?

Es gibt keine Modellfamilie, die für jede Aufgabe am besten ist. Benchmarks veralten und bilden deutsche Texte oder deinen Arbeitsalltag nur teilweise ab. Nutze Modellnamen deshalb als Startpunkt, nicht als ewige Bestenliste.

Ein multimodales Modell kann neben Text auch Bilder und je nach Modell weitere Medien wie Audio verarbeiten. Wenn du nur schreiben, zusammenfassen oder Informationen extrahieren möchtest, brauchst du diese Zusatzfunktion nicht zwingend.

Interaktiver Modell-Berater

Welche offenen Modelle passen zu deinem Gerät?

Trage Hardware und Speicher deines Rechners ein. Du bekommst eine vorsichtige Auswahl aktueller Modelle, mit denen sich der lokale Einstieg lohnt.

Welche Hardware rechnet?
Wofür möchtest du das Modell nutzen?
Zurücksetzen

Wichtig: Die Vorschläge sind Ausgangspunkte, keine Kaufempfehlung oder Zusage zur Kompatibilität. Grundlage sind platzsparend komprimierte Modelle, eine gleichzeitige Nutzung und keine sehr langen Chats, Dokumente oder Bildserien. Prüfe vor Kauf oder beruflicher Nutzung aktuelle Preise, Systemanforderungen, Modelllizenz und Datenschutz. Stand: 24. Juli 2026.

Verfügbarer SpeicherGute erste KandidatenWofür sie sich eignen
Bis etwa 8 GBGemma 4 E4B, Qwen3.5-2B, Ministral 3 3BErste Tests, kurze Zusammenfassungen, Umformulierung und Datenextraktion
Um 16 GBGemma 4 12B, Qwen3.5-9B, gpt-oss-20bVielseitiger Einzelplatz; Gemma und Qwen auch für multimodale Aufgaben, gpt-oss für Text und Schlussfolgern
24 bis 32 GBQwen3.6-27B, Qwen3.6-35B-A3B, Gemma 4 26B-A4B oder 31BAnspruchsvollere Fachaufgaben, Coding und mehr Qualitätsreserve

Beginne auch auf leistungsfähiger Hardware mit einem kleineren Vergleichsmodell. Wenn ein 9B-Modell deine Dokumente zuverlässig strukturiert, ist ein 35B-Modell für diese Aufgabe möglicherweise nur langsamer und teurer.

Vor dem Download kurz prüfen

  • Herkunft: Stammt das Basismodell aus dem offiziellen Organisationskonto und verweist die Quantisierung eindeutig darauf?
  • Modellkarte: Sind Sprachen, vorgesehene Aufgaben und bekannte Grenzen beschrieben?
  • Format: Für LM Studio, Jan und llama.cpp sind GGUF-Dateien besonders praktisch.
  • Lizenz: Ist dein privater, beruflicher oder kommerzieller Zweck erlaubt?

Modelle mit echten Aufgaben vergleichen

Eine schnelle Antwort ist nicht automatisch eine gute Antwort. Verwende für zwei oder drei Modelle dieselben eigenen Aufgaben und denselben Ausgangstext. So erkennst du, ob ein größeres Modell in deinem Alltag tatsächlich einen Vorteil bringt.

Praxistest

Ein lokales Modell vergleichbar prüfen

Verwende denselben Prompt und denselben Ausgangstext für zwei bis drei Modelle.

Arbeite ausschließlich mit dem Text zwischen <quelle> und </quelle>. 1. Fasse die drei wichtigsten Aussagen in klarer deutscher Sprache zusammen. 2. Nenne zwei Aussagen, die sich aus der Quelle nicht sicher beantworten lassen. 3. Extrahiere alle genannten Zahlen mit ihrem Kontext als Tabelle. 4. Formuliere eine vorsichtige Handlungsempfehlung. 5. Trenne belegte Informationen deutlich von deiner Interpretation. <quelle> [Text hier einfügen] </quelle>

Bewerte anschließend vier Punkte: Wurden Aufgabe und Format eingehalten? Sind die Aussagen korrekt aus der Quelle abgeleitet? Wie lange dauert die Antwort? Und passt das Ergebnis zu Lizenz, Datenschutz und deinem tatsächlichen Ablauf? Bewahre mindestens ein kleineres Modell als Vergleich auf.

Datenschutz und Sicherheit: lokal ist ein Vorteil, kein Freifahrtschein

Lokale Verarbeitung kann verhindern, dass jede Eingabe an einen externen KI-Anbieter übertragen wird. Das ist ein echter Vorteil. Trotzdem können App, Websuche, Telemetrie, Cloud-Backups oder verbundene Dienste weiterhin Daten übertragen. Auch lokale Modelle können falsche Informationen erzeugen.

Sicherer privater Start

  • Lade Apps und Modelle aus nachvollziehbaren Quellen.
  • Halte Betriebssystem, App und Laufzeit aktuell.
  • Prüfe, ob Cloud-Modelle, Websuche oder Telemetrie aktiviert sind.
  • Schütze Gerät, Chatverläufe und Dokumentenordner mit sicheren Konten und Verschlüsselung.
  • Überprüfe wichtige Aussagen weiterhin anhand verlässlicher Quellen.

Auch bei lokal betriebener KI bleiben die üblichen Datenschutzanforderungen bestehen. Für berufliche Nutzung kommen deshalb Fragen zu Rechtsgrundlage und Zweck, zulässigen Datenklassen, Rollen und Zugriffsrechten, Löschung, Backups, Lizenzen und möglichen Pflichten nach dem AI Act hinzu.

Wenn ein Modell automatisch Dokumente, Webseiten oder E-Mails verarbeitet und anschließend Aktionen ausführen darf, steigt das Risiko. Das Bundesamt für Sicherheit in der Informationstechnik warnt vor indirekten Prompt Injections: Manipulierte Anweisungen in fremden Inhalten können ein verbundenes Modell zu unerwünschten Aktionen verleiten. Solche Integrationen sollten nur mit minimalen Rechten und menschlicher Bestätigung arbeiten.

Sechs typische Fehler beim Einstieg

  1. Hardware kaufen, bevor eine echte Aufgabe getestet wurde.
  2. Nur auf die Geschwindigkeit einer Grafikkarte schauen und den VRAM übersehen.
  3. Das größte gerade noch passende Modell laden und keinen Speicher für Kontext lassen.
  4. Ein großes Modell automatisch für besser halten.
  5. Eine optionale Cloud-Funktion mit lokalem Betrieb verwechseln.
  6. Lizenz, Modellkarte, Updates und Datensicherung ignorieren.

Fazit: klein anfangen und erst nach dem Test kaufen

Der beste Einstieg in lokale offene KI beginnt nicht mit der teuersten Grafikkarte. Installiere eine zugängliche App, lade ein kleines Q4-Modell und teste drei Aufgaben aus deinem Alltag. Erst wenn Qualität oder Geschwindigkeit konkret nicht ausreichen, entscheidest du über ein größeres Modell oder neue Hardware.

Für einen neuen KI-PC sind 16 GB VRAM ein vernünftiger Einstieg; 24 bis 32 GB eröffnen deutlich stärkere Modellklassen. Viele Menschen brauchen diese Leistung jedoch nicht. Das kleinste Modell, das eine Aufgabe zuverlässig löst, ist meist die günstigere, schnellere und nachhaltigere Wahl.