1. Home
  2. Dashboard
  3. Forum
    1. Unresolved Threads
    2. Members
      1. Recent Activities
      2. Users Online
      3. Team
      4. Search Members
  4. Articles
    1. Liste funktionierender Drucker
  5. Linux Guides
    1. Homepage
    2. YouTube
    3. Telegram
    4. Community-Stammtisch
  6. Lexicon
    1. Last Changes
  7. Smart Search
  • Login
  • Register
  • Search
Default Category
  • Everywhere
  • Default Category
  • Articles
  • Pages
  • Forum
  • Lexikon
  • More Options
  1. Linux Guides Community
  2. Lexicon
  3. Default Category

Ollama

  • Forwared from „ollama“
  • Tuxine
  • July 1, 2026 at 9:11 AM
  • 42 times viewed
  • Eintrag
  • Ratings 0
  • Ollama ist ein hochentwickeltes, schlankes Open-Source-Framework für Linux, macOS und Windows, das es ermöglicht, große Sprachmodelle (LLMs) mit einem einzigen Befehl lokal, effizient und komplett offline auf der eigenen Hardware auszuführen.

    Klick für mehr ...

    1 🦙 Ollama (Der lokale KI-Server)

    Ollama ist ein bahnbrechendes Open-Source-Werkzeug, das die Ausführung von künstlicher Intelligenz radikal demokratisiert hat. Früher war das lokale Starten von großen Sprachmodellen (Large Language Models – LLMs) ein komplexes Unterfangen, das tiefe Kenntnisse über Python-Umgebungen, CUDA-Treiber und mathematische Quantisierungsformate voraussetzte. Ollama verpackt diese gesamte Komplexität in ein extrem schlankes, in Go geschriebenes Tool. Es fungiert im Grunde als das „Docker für KI-Modelle“: Ein einziger Befehl im Terminal genügt, um Modelle wie Llama 3.1, Gemma, Mistral oder Phi-3 herunterzuladen und direkt auf der eigenen Grafikkarte oder CPU auszuführen – zu 100 % offline und datenschutzkonform.

    2 🦙 OLLAMA (Die Architektur unter der Haube)

    2.1 🔬 DIE PHILOSOPHIE:

    Die Philosophie von Ollama bricht mit dem Zwang von proprietären Cloud-Diensten. Statt deine Daten an Server im Ausland zu schicken, holt Ollama das „Gehirn“ auf deine eigene SSD.

    • Das CLI- und Daemon-Prinzip:
      Ollama läuft nach der Installation als Systemd-Dienst (Daemon) im Hintergrund. Es stellt eine mächtige Kommandozeilen-Schnittstelle (CLI) bereit, über die du Modelle verwaltest.
    • Die REST-API:
      Das eigentliche Herzstück für Entwickler und Admins. Ollama öffnet standardmäßig den lokalen Port 11434. Über diesen Port stellt es eine zu OpenAI kompatible API bereit.
      Das bedeutet:
      Jedes moderne Frontend (wie Open WebUI) kann sich einfach an diesen Port hängen und die Rechenleistung abgreifen.

    2.2 ⚙️ HARDWARE-BESCHLEUNIGUNG (GPU VS. CPU)

    LLMs benötigen Milliarden von mathematischen Matrix-Berechnungen pro Sekunde. Ollama entscheidet beim Start vollautomatisch, welche Hardware genutzt wird:

    1. NVIDIA:
      Wenn eine Nvidia-Grafikkarte im System steckt, lagert Ollama das Modell komplett in den VRAM der GPU aus. Das sorgt für rasend schnelle Antworten (hohe Tokens-per-Second).
    2. AMD:
      Unter Linux unterstützt Ollama AMD-Grafikkarten nativ über das ROCm-Framework.
    3. CPU-Fallback:
      Besitzt das System keine dedizierte Grafikkarte (wie viele stromsparende Mini-PCs), nutzt Ollama die CPU und den normalen Arbeitsspeicher. Dank der genialen Integration von llama.cpp geschieht dies über hocheffiziente AVX2/AVX512-Befehlssätze, sodass kleinere Modelle (z. B. mit 8 Milliarden Parametern) auch auf einem Intel N100 erstaunlich flüssig laufen.

    3 📦 PRAKTISCHE ANWENDUNG & TERMINAL-BEFEHLE

    Die Installation und Verwaltung von Ollama unter Linux ist so einfach wie bei kaum einem anderen modernen Werkzeug.

    3.1 Der universelle Installations-Befehl

    Die Entwickler stellen ein offizielles, hervorragend gepflegtes Skript bereit, das die Linux-Distribution (Debian, Arch, Fedora etc.) automatisch erkennt, den Systemd-Dienst einrichtet und Grafiktreiber konfiguriert:

    Code
    curl -fsSL https://ollama.com/install.sh | sh

    3.2 Die wichtigsten CLI-Befehle für den Alltag

    Ein Modell herunterladen und sofort im Terminal eine interaktive Chat-Sitzung starten:

    Code
    ollama run llama3.1

    (Hinweis: Wenn das Modell noch nicht auf der Platte ist, lädt Ollama es automatisch im Hintergrund herunter!)

    Alle lokal heruntergeladenen Modelle übersichtlich auflisten:

    Code
    ollama list

    Ein nicht mehr benötigtes Modell von der Festplatte löschen, um wertvollen Speicherplatz freizugeben:

    Code
    ollama rm gemma2

    Prüfen, welches Modell aktuell im Arbeitsspeicher/Grafikspeicher läuft und wie viel RAM es belegt:

    Code
    ollama ps

    4 ⚠️ DIE HÄUFIGSTEN STOLPERSTEINE

    4.1 Das Modell antwortet unendlich langsam (Das RAM-Dilemma)

    • Das Problem:
      Der Nutzer tippt einen Prompt ein, aber Ollama generiert nur ein Wort alle zwei Sekunden.
    • Die Ursache:
      Das Modell ist zu groß für den verfügbaren Grafikspeicher (VRAM) oder den RAM. Muss Ollama das Modell zwischen VRAM und normalem System-RAM aufteilen, bricht die Performance dramatisch ein.
    • Die Lösung:
      Ein quantisiertes 8B-Modell (8 Milliarden Parameter wie Llama 3.1 8B) benötigt knapp 5 bis 6 GB freien Speicher. Hat der Mini-PC oder die Grafikkarte weniger Platz, greift man zu kleineren, extrem schnellen Modellen wie phi3 (3.8B) oder qwen2.5:3b.

    4.2 Ollama ist über das Netzwerk nicht erreichbar

    • Das Problem:
      Der Nutzer betreibt Ollama auf einem Mini-PC im Keller und möchte von seinem Laptop über Open WebUI darauf zugreifen, erhält aber einen Verbindungsfehler.
    • Die Ursache:
      Aus Sicherheitsgründen lauscht der Ollama-Dienst nach der Standardinstallation ausschließlich auf 127.0.0.1 (localhost). Anfragen aus dem lokalen Netzwerk werden blockiert.
    • Die Lösung:
      Den Systemd-Dienst anpassen. Das geht unter Debian und Arch und Co sauber über einen Override:
      1. Den Editor für den Dienst öffnen:

        Code
        sudo systemctl edit ollama.service
      2. Im leeren Bereich zwischen den Kommentarzeilen folgenden Block einfügen (erlaubt Zugriffe von jeder IP und konfiguriert Cors):

        Code
        [Service]
        Environment="OLLAMA_HOST=0.0.0.0"
        Environment="OLLAMA_ORIGINS=*"
      3. Speichern, schließen und den Dienst neu starten:

        Code
        sudo systemctl daemon-reload
        Code
        sudo systemctl restart ollama

    5 🔄 MODELL-KLASSEN IM SCHNELLCHECK

    Modell-TagGröße auf der SSDMindest-RAM/VRAMTypischer Einsatzzweck
    phi3:mini (~3.8B)~2.2 GB🟢 4 GBIdeal für schwache Hardware, Mini-PCs, schnelle Aufgaben.
    llama3.1 (~8B)~4.7 GB🟡 8 GBDer Standard-Allrounder für logisches Denken und Coding.
    mistral (~7B)~4.1 GB🟡 8 GBHervorragend für kreative Texte und Zusammenfassungen.
    llama3.1:70b~40 GB🔴 64 GBNur für mächtige Server / High-End-Workstations geeignet.

    6 📝 FAZIT

    Ollama hat das Thema Künstliche Intelligenz im Open-Source-Bereich revolutioniert. Es nimmt der lokalen KI-Nutzung jeglichen Schrecken. Zusammen mit einem schönen Frontend wie Open WebUI baut man sich innerhalb von fünf Minuten eine private, unzensierte Wissensdatenbank, die absolut keine Daten ins Netz verliert.

    • KI
There are currently no ratings for this Eintrag.
  • Previous entry Okular
  • Next entry Open Source
  • PDF
25-linuxguides-png

Table of Contents

  • 1 🦙 Ollama (Der lokale KI-Server)
  • 2 🦙 OLLAMA (Die Architektur unter der Haube)
    • 2.1 🔬 DIE PHILOSOPHIE:
    • 2.2 ⚙️ HARDWARE-BESCHLEUNIGUNG (GPU VS. CPU)
  • 3 📦 PRAKTISCHE ANWENDUNG & TERMINAL-BEFEHLE
    • 3.1 Der universelle Installations-Befehl
    • 3.2 Die wichtigsten CLI-Befehle für den Alltag
  • 4 ⚠️ DIE HÄUFIGSTEN STOLPERSTEINE
    • 4.1 Das Modell antwortet unendlich langsam (Das RAM-Dilemma)
    • 4.2 Ollama ist über das Netzwerk nicht erreichbar
  • 5 🔄 MODELL-KLASSEN IM SCHNELLCHECK
  • 6 📝 FAZIT

Categories

  1. Anfängerfragen 0
  2. Default Category 667
  1. Privacy Policy
  2. Legal Notice
  1. Nutzungsbedingungen
Lexicon, developed by www.viecode.com
Powered by WoltLab Suite™