Ollama installieren: Lokale KI einfach nutzen
Ollama ohne Vorwissen einrichten: App installieren, ein passendes lokales Modell laden, chatten, PDFs und Bilder nutzen und Cloud-Modelle sicher unterscheiden.
In diesem Artikel
Artikel
- Lesezeit
- 6 Min. Lesezeit
- Veröffentlicht
- Format
- Einsteiger-Guide
- Niveau
- Einsteiger
- Thema
- Datenschutz
Ollama war lange vor allem als Werkzeug für das Terminal bekannt. Inzwischen ist der Einstieg deutlich einfacher: Auf macOS und Windows gehört eine grafische App dazu, in der du Modelle suchen, herunterladen und direkt mit ihnen chatten kannst. Textdateien, PDFs und Bilder lassen sich per Drag-and-drop hinzufügen – ganz ohne Befehle.
In diesem Quick Start installierst du Ollama, lädst ein kleines lokales Modell und prüfst, ob deine Unterhaltung wirklich auf dem eigenen Computer verarbeitet wird. Für den ersten Test brauchst du weder Programmierkenntnisse noch ein Konto.
Das brauchst du
- einen Mac mit macOS 14 Sonoma oder neuer oder einen PC mit Windows 10 22H2 oder neuer;
- mehrere Gigabyte freien Speicher für Ollama und mindestens ein Modell;
- eine Internetverbindung für Installation und Modelldownload;
- für den bequemen Einstieg idealerweise 16 GB Arbeitsspeicher – kleinere Modelle können auch auf schwächeren Geräten funktionieren.
Zeitbedarf: etwa 10 bis 20 Minuten, abhängig von deiner Internetverbindung.
Schritt 1: Ollama von der offiziellen Website herunterladen
Öffne die offizielle Download-Seite von Ollama und wähle dein Betriebssystem. Nutze keine Download-Portale oder inoffiziellen Installer.
Auf dem Mac
- Lade die macOS-Version herunter und öffne die DMG-Datei.
- Ziehe Ollama in den Ordner „Programme“.
- Starte Ollama. macOS kann beim ersten Öffnen um eine Bestätigung bitten.
Für die aktuelle Version brauchst du macOS 14 oder neuer. Auf Macs mit Apple-Chip nutzt Ollama CPU und GPU; ältere Intel-Macs rechnen nur über die CPU und sind deshalb meist deutlich langsamer.
Unter Windows
- Lade den Windows-Installer herunter und öffne ihn.
- Folge den Installationsschritten. Für die Standardinstallation brauchst du keine Administratorrechte.
- Öffne Ollama anschließend über das Startmenü.
Unter Windows brauchst du Windows 10 22H2 oder neuer. Geeignete NVIDIA- und AMD-Grafikkarten können die Berechnung beschleunigen. Auch ohne separate Grafikkarte kann ein kleines Modell laufen, Antworten können dann aber länger dauern.
Wichtig für Linux
Die hier beschriebene grafische App gibt es derzeit für macOS und Windows. Unter Linux kannst du Ollama im Terminal installieren und starten. Die Befehle am Ende dieses Guides funktionieren dort ebenfalls.
Schritt 2: Ein passendes lokales Modell auswählen
Ollama ist die App, nicht das KI-Modell selbst. Beim ersten Start wählst du daher ein Modell aus. Suche im Modellmenü nach Qwen3.5 4B beziehungsweise qwen3.5:4b. Der Download ist rund 3,4 GB groß. Das Modell verarbeitet Text und Bilder und unterstützt viele Sprachen – ein sinnvoller erster Test für einen Computer mit 16 GB Arbeitsspeicher.
Ist dein Gerät knapp ausgestattet oder reagiert sehr langsam, probiere qwen3.5:2b mit rund 2,7 GB. Hast du deutlich mehr freien Speicher, kannst du später qwen3.5:9b mit rund 6,6 GB vergleichen. Die Dateigröße ist allerdings nicht der gesamte Speicherbedarf: Betriebssystem, App, Unterhaltung und angehängte Dateien benötigen zusätzlich RAM oder Grafikspeicher.
- Öffne in der App die Modellauswahl.
- Suche nach dem exakten Modellnamen.
- Wähle eine lokale Variante ohne den Zusatz
:cloud. - Starte den Download und warte, bis das Modell vollständig auf deinem Gerät liegt.
Im Ollama-Modellkatalog findest du die verfügbaren Größen und Varianten. Ollama kann offene Modelle ausführen, aber jedes Modell hat eigene Nutzungsbedingungen. Für Qwen3.5 gilt die Apache License 2.0.
Schritt 3: Den ersten lokalen Chat testen
Wähle das heruntergeladene Modell aus und beginne mit einer einfachen Aufgabe. So trennst du Installationsprobleme von anspruchsvollen Tests.
Erkläre mir in fünf kurzen Sätzen, was ein lokales KI-Modell ist. Schreibe verständlich und nenne auch eine Grenze.
Die erste Antwort kann länger dauern, weil Ollama das Modell zunächst in den Speicher lädt. Danach sollten weitere Antworten schneller starten. Teste anschließend zwei Aufgaben aus deinem Alltag, etwa eine E-Mail zu strukturieren oder einen eigenen Text zu kürzen. Prüfe die Ergebnisse genauso kritisch wie bei einer Cloud-KI: Lokale Modelle können Fakten erfinden, Anweisungen missverstehen oder wichtige Details übersehen.
Schritt 4: PDFs, Textdateien und Bilder verwenden
Textdateien, PDFs und Code-Dateien kannst du per Drag-and-drop in den Chat ziehen. Stelle anschließend eine konkrete Frage, zum Beispiel: „Fasse die drei wichtigsten Aussagen zusammen und nenne jeweils die Seite.“
Für Bilder brauchst du ein multimodales Modell. Qwen3.5 verarbeitet Text- und Bildeingaben. Ziehe ein Bild in den Chat und frage zunächst nach einer sachlichen Beschreibung. Kontrolliere Zahlen, kleine Beschriftungen und feine Details besonders sorgfältig.
Bei langen PDFs kann der verfügbare Kontext nicht ausreichen. In den Einstellungen kannst du die Kontextlänge erhöhen, dadurch steigt allerdings auch der Speicherbedarf. Beginne deshalb mit einem kurzen Dokument und ändere die Einstellung nur, wenn Inhalte abgeschnitten werden.
So prüfst du, ob das Modell wirklich lokal läuft
Ollama bietet inzwischen neben lokalen Modellen auch Cloud-Modelle an. Beide erscheinen in derselben Umgebung, werden aber an unterschiedlichen Orten berechnet. Ein Cloud-Modell wird an Ollamas Dienst ausgelagert und benötigt ein Konto. In der Modellbezeichnung erkennst du es typischerweise am Zusatz :cloud.
Lokaler Kurzcheck
- Das Modell wurde als mehrere Gigabyte große Datei heruntergeladen.
- Im Modellnamen steht nicht
:cloud. - Der Chat funktioniert nach dem Download auch bei vorübergehend getrennter Internetverbindung.
- Websuche und andere Online-Funktionen sind für den Test ausgeschaltet.
Bei lokal laufenden Modellen überträgt Ollama Eingaben und Antworten nicht an ollama.com. Bei Cloud-Modellen verarbeitet der Dienst diese Daten dagegen, um die Anfrage auszuführen. Wenn du Ollama strikt lokal nutzen möchtest, kannst du die Cloud-Funktionen mit der Einstellung disable_ollama_cloud oder der Umgebungsvariable OLLAMA_NO_CLOUD=1 deaktivieren. Das ist eher ein zweiter Schritt; für einen ersten Test genügt die bewusste Auswahl eines heruntergeladenen lokalen Modells.
Häufige Probleme beim Einstieg
Das Modell antwortet sehr langsam
Schließe speicherintensive Programme und wähle eine kleinere Modellvariante. Langsame Antworten bedeuten nicht automatisch, dass die Installation defekt ist. Besonders die reine Berechnung über die CPU kann Geduld verlangen.
Der Download bricht ab oder die SSD wird voll
Prüfe freien Speicherplatz und Internetverbindung. Für die Anwendung selbst solltest du unter Windows mindestens 4 GB einplanen; Modelldateien kommen zusätzlich hinzu und können erheblich größer sein. Lade für den ersten Test nur eine Variante herunter.
Ein PDF wird unvollständig ausgewertet
Teile ein langes Dokument in kleinere Abschnitte oder frage gezielt nach bestimmten Kapiteln. Eine größere Kontextlänge kann helfen, benötigt aber mehr Speicher und garantiert keine fehlerfreie Analyse.
Die App öffnet sich, aber der Chat startet nicht
Beende Ollama vollständig und starte die App neu. Prüfe außerdem, ob der Modelldownload abgeschlossen ist. Auf macOS und Windows werden Updates automatisch heruntergeladen und nach einem Neustart der App angewendet.
Optional: Ollama im Terminal oder über die lokale API nutzen
Die grafische App reicht für Chat, Dateien und Bilder aus. Interessant wird Ollamas technische Ebene, wenn du später ein Schreibprogramm, ein Skript oder ein Entwicklungswerkzeug mit deinem lokalen Modell verbinden möchtest.
Mit ollama öffnest du ein interaktives Terminalmenü. Der Befehl ollama run qwen3.5:4b startet das Modell direkt. Nach der Installation steht außerdem standardmäßig eine lokale Schnittstelle unter http://localhost:11434/api bereit. Du musst sie für diesen Guide weder konfigurieren noch ins Netzwerk freigeben.
Wie geht es weiter?
Wenn dein erster Chat funktioniert, teste drei echte Aufgaben und notiere Qualität, Geschwindigkeit und Speicherbedarf. Lade erst danach ein größeres Modell. So findest du heraus, was dein vorhandener Computer leisten kann, bevor du über neue Hardware nachdenkst.
Unser ausführlicher Guide „Open-Source-KI lokal nutzen: Modelle, Software und Hardware“ erklärt, wie Modellgröße, RAM, VRAM und Quantisierung zusammenhängen und welche Modellklasse zu deinem Gerät passt.