Vorschau-Umgebung - hier siehst du auch noch nicht freigegebenen Content.
Einstieg15 Min.ollamalocal-llmsetup

Ollama installieren und das erste Modell laden

In 15 Minuten von „nichts" zu einem lokal laufenden LLM, das du per Terminal und HTTP-API ansprichst - ohne API-Key, ohne Cloud.

Video

Video folgt

Hier erscheint demnächst eine begleitende Video-Anleitung.

Ollama ist die einfachste Art, große Sprachmodelle lokal auf deinem Rechner laufen zu lassen. Es kümmert sich um Download, GPU-Erkennung, Quantisierung und stellt dir eine OpenAI-kompatible HTTP-API auf localhost:11434 bereit. Genau das, was du für die Playground- und Tutorial-Phasen dieses Projekts brauchst, wenn du keinen Anthropic-Key benutzen willst.

Am Ende dieses Tutorials hast du:

  • Ollama installiert und als Hintergrunddienst laufen
  • Ein Modell heruntergeladen (Llama 3.2 oder Mistral)
  • Erfolgreich einen Chat im Terminal geführt
  • Den HTTP-Endpoint mit curl getestet

Schritt 1 - Ollama installieren

Die Installation unterscheidet sich pro Betriebssystem, ist aber in jedem Fall ein One-Liner oder ein normaler Installer.

macOS und Windows: Lade den nativen Installer von ollama.com/downloadExtern - Öffnet in neuem Tab. Auf macOS ist es eine .dmg, auf Windows eine .exe. Doppelklicken, durchklicken, fertig - Ollama startet automatisch als Hintergrunddienst.

Linux: Installer-Skript direkt von der offiziellen Quelle:

bash

Das Skript erkennt deine Distro, installiert nach /usr/local/bin/ollama und richtet einen systemd-Service ein.

Schritt 2 - Hintergrunddienst prüfen

Ollama läuft als Daemon auf Port 11434. Das ist die Stelle, an die später dein Code Requests schickt.

bash

Wenn du nichts siehst oder einen Connection-Refused-Fehler bekommst:

  • macOS: Ollama-App im Dock starten (das Llama-Icon in der Menüleiste)
  • Windows: Im Startmenü „Ollama" suchen und starten
  • Linux: systemctl status ollama - falls inaktiv: systemctl start ollama

Schritt 3 - Erstes Modell herunterladen

Ollama hat einen Modell-Katalog auf ollama.com/libraryExtern - Öffnet in neuem Tab. Für den Anfang empfehlen wir Llama 3.2 in der 3B-Variante - schnell, klein (~2 GB), und qualitativ ausreichend für Tool-Use-Demos.

bash

Du siehst einen Fortschrittsbalken, der mehrere Layer parallel zieht. Bei normaler DSL-Leitung dauert das 1-3 Minuten.

Schritt 4 - Im Terminal chatten

Schnellster Test, ob das Modell funktioniert:

bash

Mit /bye oder Ctrl+D verlässt du den Chat. Das Modell bleibt geladen - beim nächsten ollama run startet es ohne Verzögerung.

Schritt 5 - Den HTTP-Endpoint testen

Genau diesen Endpoint wird der Playground später ansprechen. Stell sicher, dass er antwortet:

bash

Die Antwort ist ein JSON-Objekt mit response, total_duration (Nanosekunden), prompt_eval_count und eval_count (Tokens). Genau die Felder, die wir später brauchen, um Token-Verbrauch sichtbar zu machen.

Troubleshooting

„Error: model requires more system memory" - das Modell ist zu groß für deinen RAM. Probier eine kleinere Variante (:3b oder :1b) oder eine stärkere Quantisierung (:q4_0).

Sehr langsam, aber GPU vorhanden - ollama ps zeigt, ob das Modell tatsächlich auf der GPU läuft (PROCESSOR sollte 100% GPU sein). Falls nicht: CUDA-Treiber/ROCm-Installation prüfen.

Port 11434 belegt - OLLAMA_HOST=0.0.0.0:11500 ollama serve startet auf einem anderen Port. Den musst du dann auch im Playground/Code als LLM_BASE_URL eintragen.

Downloads & Cheat-Sheets

Noch keine Downloads

Cheat-Sheets und Vorlagen ergänzen wir kurz nach Veröffentlichung.

Diskussion· noch keine Beiträge

Unser Kommentar-Agent liest jeden neuen Beitrag, bedankt sich oder empfiehlt passende Inhalte.

Sei die erste Stimme - was denkst du dazu?

Melde dich an, um mitzudiskutieren.

Anmelden