Was ist Ollama?
Ollama ist ein kleines, kostenloses Programm, das große Sprachmodelle direkt auf deiner eigenen Hardware ausführt. Du lädst ein Modell einmal herunter und kannst es danach beliebig oft benutzen.
💸 Kostenlos
Keine Token-Abrechnung, kein Abo, kein Limit. Du zahlst nur den Strom.
🔒 Privat
Kein Wort verlässt deinen Rechner oder dein Netzwerk. Kein Anbieter liest mit.
✈️ Offline
Ist das Modell einmal geladen, funktioniert Jon auch ohne Internet.
Voraussetzungen
| Minimum | Empfohlen | |
|---|---|---|
| Arbeitsspeicher | 8 GB | 16 GB und mehr |
| Grafikspeicher | keiner (läuft auf der CPU) | 8 GB VRAM und mehr |
| Festplatte | 2 GB je kleinem Modell | 20 GB und mehr |
| System | Windows 10/11, macOS, Linux | — |
Faustregel: Ein Modell braucht ungefähr so viel Speicher, wie seine Datei groß ist. Ein 3B-Modell passt fast überall, ein 70B-Modell braucht eine dicke Grafikkarte.
Installation
Ollama herunterladen
Von ollama.com/download, Installer starten — fertig. Ollama läuft danach im Hintergrund auf Port 11434.
Erstes Modell laden
ollama pull llama3.2Kurz prüfen
Kommt hier eine Versionsnummer zurück, ist alles bereit:
curl http://127.0.0.1:11434/api/versionEinrichtung in Jon
Einstellungen öffnen
Jon starten, dann Zahnrad-Menü oben rechts und weiter zum Bereich Ollama.
Ollama einschalten
Schalter Ollama verwenden auf an, dann Server & Modelle … öffnen.
Verbinden und Modell wählen
Verbindung testen drücken — steht oben Online, hat es geklappt. Modell auswählen, Speichern, oben im Chat als Anbieter ollama wählen.
Alle Einstellungen landen in data/ollama.json und werden beim Start automatisch geladen.
Server konfigurieren
Läuft Ollama auf demselben PC wie Jon, musst du nichts einstellen — 127.0.0.1:11434 ist die Voreinstellung.
Soll Ollama von anderen Geräten erreichbar sein, muss der Server auf allen Netzwerkkarten lauschen. Das stellst du auf dem Ollama-Rechner ein:
Windows
In PowerShell, danach Ollama neu starten:
setx OLLAMA_HOST 0.0.0.0macOS / Linux
export OLLAMA_HOST=0.0.0.0Als systemd-Dienst gehört es in /etc/systemd/system/ollama.service.d/override.conf unter [Service] als Environment="OLLAMA_HOST=0.0.0.0". Danach systemctl daemon-reload und systemctl restart ollama.
Port konfigurieren
Standard ist 11434. Einen anderen Port setzt du auf dem Server über OLLAMA_HOST=0.0.0.0:11500 und trägst ihn in Jon im Feld Port ein.
Firewall nicht vergessen
Unter Windows auf dem Ollama-Rechner:
netsh advfirewall firewall add rule name="Ollama" dir=in action=allow protocol=TCP localport=11434Host konfigurieren
Im Ollama-Fenster beschreiben mehrere Felder dieselbe Sache — nimm, was dir lieber ist:
| Feld | Beispiel | Bedeutung |
|---|---|---|
| Server-URL | http://192.168.1.50:11434 | Komplette Adresse auf einmal |
| Host / IP | 192.168.1.50 | Nur der Rechner |
| Port | 11434 | Nur die Nummer |
| Protokoll | http oder https | Für eigene Server hinter einem Proxy |
Tippst du oben eine vollständige URL ein, füllen sich Host, Port und Protokoll von selbst — und umgekehrt. Darunter schlägt Jon die Adressen dieses PCs zum Anklicken vor: localhost, Heimnetz (LAN) und Tailscale.
Verbindung von Jon zum Server
| Szenario | Host | Port |
|---|---|---|
| Ollama auf demselben PC | 127.0.0.1 | 11434 |
| Anderer PC im Heimnetz | 192.168.x.x oder 10.x.x.x | 11434 |
| Rechner über Tailscale | 100.x.x.x | 11434 |
| Eigener Server mit HTTPS | ollama.meinedomain.de mit https | 443 |
Nutzung über LAN
Server öffnen
Auf dem Ollama-Rechner OLLAMA_HOST=0.0.0.0 setzen und Ollama neu starten.
IP-Adresse herausfinden
Windows: ipconfig · macOS und Linux: ip addr
Firewall freigeben
Port 11434 für eingehende TCP-Verbindungen erlauben.
In Jon eintragen
Host und Port ins Ollama-Fenster, dann Verbindung testen drücken.
Nutzung über Tailscale
Tailscale verbindet deine Geräte verschlüsselt, egal wo sie stehen — ohne eine einzige Portfreigabe im Router.
Auf beiden Geräten installieren
Mit demselben Konto anmelden.
Ollama öffnen
Auf dem Ollama-Rechner OLLAMA_HOST=0.0.0.0 setzen.
Tailscale-Adresse ablesen
Sie beginnt mit 100.:
tailscale ip -4In Jon eintragen
Adresse als Host, Port 11434. Damit läuft das Modell zu Hause auf der großen Grafikkarte, während Jon unterwegs auf dem Laptop damit arbeitet.
Verbindung testen
Der Knopf Verbindung testen speichert deine Serverdaten und fragt den Server sofort ab. Oben im Fenster steht danach jederzeit:
Der Status aktualisiert sich alle 15 Sekunden von selbst; Status aktualisieren fragt sofort nach. Mögliche Zustände: Online, Offline, Verbinde … und Ausgeschaltet.
Modelle installieren
Modelle werden immer auf dem Server installiert, nicht in Jon:
Im Terminal des Ollama-Rechners
ollama pull llama3.2
ollama pull qwen2.5-coder:7b
ollama listDanach in Jon auf Neu laden klicken — die Liste kommt frisch vom Server.
| Modell | Größe | Wofür |
|---|---|---|
llama3.2 | ~2 GB | Allrounder, läuft fast überall |
qwen2.5-coder:7b | ~4,7 GB | Programmieren |
mistral | ~4,1 GB | Schnelle Alltagsantworten |
llama3.3:70b | ~40 GB | Sehr stark, braucht viel VRAM |
Modelle wechseln
Zwei Wege, gleiches Ergebnis: im Ollama-Fenster unter Modell auswählen und speichern — oder oben im Chat den Anbieter ollama wählen und daneben das Modell. Jon hält beide Stellen synchron.
does not support tools, wiederholt Jon die Anfrage automatisch ohne Werkzeuge und antwortet trotzdem. Werkzeuge beherrschen zum Beispiel llama3.1, llama3.3, qwen2.5 und mistral-nemo.Server für andere freigeben
Läuft auf deinem Rechner eine starke Grafikkarte, kannst du deinen Ollama-Server für andere Jon-Nutzer freigeben. Sie chatten dann über dein Modell, ohne selbst etwas zu installieren — und ohne Zugriff auf irgendetwas anderes auf deinem PC.
Freigeben (als Besitzer)
Bereich öffnen
Zahnrad-Menü → Ollama → Server & Modelle …, dort ganz unten Serverfreigabe.
Einschalten und beschreiben
Schalter Meinen Ollama-Server freigeben an, dann Freigabename und Beschreibung eintragen — das sehen die anderen.
Sichtbarkeit wählen
Privat, Nur Eingeladene oder Öffentlich (siehe Tabelle unten).
Code weitergeben
Der Code sieht aus wie AB39KD12, der Link wie jon://ollama/AB39KD12@192.168.1.50:8758. Beides gibt es auf Klick in die Zwischenablage.
| Sichtbarkeit | Bedeutung |
|---|---|
| Privat | Niemand kommt neu herein. Bereits verbundene Benutzer behalten ihren Zugang, bis du ihn widerrufst. |
| Nur Eingeladene | Nur wer eine persönliche Einladung von dir hat. Jede Einladung gilt für genau einen Benutzer und verfällt nach der ersten Nutzung. |
| Öffentlich | Jeder mit deinem Freigabecode darf sich verbinden. |
Verbinden (als Gast)
Code eintragen
Im selben Fenster unter Freigegebene Server nutzen den Code oder Link einfügen und auf Verbinden klicken.
Modell wählen
Die Modelle des fremden Servers stehen sofort oben in der KI-Auswahl beim Anbieter ollama, gruppiert unter „Freigabe <Code>".
Ganz normal chatten
Verlauf, Streaming und deine eigenen Ollama-Einstellungen (Temperatur, Top P, Top K, Max Tokens, Context Length, Keep Alive, Seed, System Prompt, Timeout) gelten weiter.
Im Heimnetz genügt der Code allein — Jon sucht den Server im Netzwerk. Über Tailscale oder von außerhalb nimmt man den Link mit Adresse.
Verwalten
Unter Verbundene Benutzer siehst du zu jedem Gast Name und Adresse, den Verbindungsstatus, das gerade genutzte Modell, Sitzungen und Anfragen sowie die letzte Aktivität:
entfernen wirft einen einzelnen Benutzer hinaus, Allen Zugriff entziehen alle auf einmal. Beides gilt sofort — auch mitten in einer laufenden Antwort. Mit Neuen Code erzeugen wird der alte Freigabecode ungültig.
Sicherheit der Freigabe
🎫 Nichts ist offen zugänglich
Jeder Gast bekommt beim Beitritt ein eigenes Zugriffstoken mit 256 Bit. Ohne gültiges Token beantwortet Jon keine einzige Anfrage — auch nicht bei öffentlicher Sichtbarkeit.
🔑 Tokens nur als Hash
Gespeichert wird ausschließlich ein SHA-256-Hash, verglichen wird zeitkonstant.
🚪 Nur das Modell
Freigegeben ist allein das Antworten deines Ollama-Servers. Chats, Dateien, Werkzeuge und PC-Steuerung bleiben unerreichbar — die Werkzeuge des Gastes laufen auf seinem eigenen Rechner.
🧱 Getrennter Port
Die Freigabe hängt am Chat-Port 8758, nicht an Jons Steuer-API auf 127.0.0.1:8756.
⏱️ Bremse gegen Raten
Zu viele Fehlversuche in Folge werden pro Adresse ausgebremst.
🧠 Dein Speicher bleibt deiner
Die Sampling-Werte des Gastes gelten, aber Context Length und Max Tokens werden auf deine eigenen Einstellungen gedeckelt — dein Keep Alive bleibt gültig.
🛑 Aus heißt aus
Schaltest du die Freigabe ab, sind alle Tokens augenblicklich ungültig.
Alle Einstellungen
| Einstellung | Bedeutung | Standard |
|---|---|---|
| Ollama verwenden | Schaltet Ollama als Anbieter an und aus | an |
| Server-URL, Host, Port, Protokoll | Wo der Server läuft | http://127.0.0.1:11434 |
| Modell | Das Modell, mit dem Jon antwortet | — |
| Modelle automatisch laden | Modell-Liste selbstständig vom Server holen | an |
| Temperatur | 0 ist nüchtern, 2 ist sehr kreativ | 0.7 |
| Top P | Anteil der berücksichtigten Wortwahrscheinlichkeiten | 0.9 |
| Top K | Wie viele Wortkandidaten pro Schritt betrachtet werden | 40 |
| Max Tokens | Maximale Länge der Antwort, -1 bedeutet ohne Limit | 32768 |
| Context Length | Größe des Gedächtnisfensters | 4096 |
| Keep Alive | Wie lange das Modell im Speicher bleibt | 5m |
| Seed | Feste Zahl bedeutet reproduzierbare Antworten, -1 ist zufällig | -1 |
| System Prompt | Zusatzanweisung für jedes Ollama-Gespräch | leer |
| Streaming | Antwort live mitschreiben statt am Stück | an |
| Timeout | Wie lange Jon auf eine Antwort wartet, in Sekunden | 120 |
| Automatisch neu verbinden | Bei Abbruch bis zu dreimal erneut versuchen | an |
Keep Alive versteht 5m, 30s, 1h, 0 für sofortiges Entladen und -1 für dauerhaft geladen. Eine größere Context Length kostet spürbar Speicher.
Fehlerbehebung
| Meldung | Ursache | Lösung |
|---|---|---|
| Keine Verbindung zu Ollama unter … | Server läuft nicht oder falsche Adresse | Ollama starten, Host und Port prüfen |
| … antwortet nicht | Firewall blockt oder OLLAMA_HOST fehlt | OLLAMA_HOST=0.0.0.0 setzen, Port freigeben |
| Das Modell X ist nicht installiert | Modell fehlt auf dem Server | ollama pull X auf dem Server |
| Ollama hat zu lange gebraucht | Modell zu groß für die Hardware | Timeout erhöhen oder kleineres Modell nehmen |
| … passt nicht in den Speicher | Zu wenig RAM oder VRAM | Kleineres Modell oder Context Length senken |
| Ollama ist ausgeschaltet | Der Schalter steht auf aus | Zahnrad-Menü, Bereich Ollama, einschalten |
| Keine Modelle in der Liste | Noch keins installiert | ollama pull llama3.2, dann Neu laden |
| Kein Server mit diesem Code im Netzwerk gefunden | Freigabe aus, anderes Netz oder UDP 8762 zu | Einladungslink mit Adresse nehmen: CODE@ip:8758 |
| Der Zugriff wurde widerrufen | Besitzer hat dich entfernt oder die Freigabe abgeschaltet | Neuen Freigabecode erfragen |
| Diese Einladung wurde bereits verwendet | Einladungen gelten einmalig | Neue Einladung erstellen lassen |
Jon stürzt in keinem dieser Fälle ab: Die Meldung erscheint als Text, und nach der Korrektur genügt Verbindung testen.
FAQ
Kostet Ollama etwas?
Nein. Programm und Modelle sind kostenlos, es gibt keine Token-Abrechnung.
Braucht Jon dann noch einen API-Schlüssel?
Für Ollama nicht. Alle anderen Anbieter funktionieren unverändert weiter.
Muss ich online sein?
Nur zum Herunterladen der Modelle. Danach läuft alles offline.
Ollama und Cloud parallel?
Ja. Der Anbieter oben im Chat ist jederzeit umschaltbar; Mini Jon und Telegram dürfen ein anderes Modell nutzen.
Warum ist es langsamer als die Cloud?
Weil es auf deiner Hardware rechnet. Kleine Modelle von 1B bis 8B sind auf einer normalen Grafikkarte trotzdem sehr flott.
Kann Jon Bilder ansehen?
Ja, mit einem Vision-Modell wie llava oder llama3.2-vision.
Wo liegen meine Einstellungen?
In data/ollama.json. Das Backup im Zahnrad-Menü nimmt sie mit.
Welche Schnittstelle nutzt Jon?
Die offizielle Ollama-API: /api/chat, /api/tags und /api/version.
Kann jemand über meine Freigabe meinen PC steuern?
Nein. Freigegeben ist nur das Antworten des Modells. Werkzeuge, Dateien und PC-Steuerung laufen immer auf dem Rechner des jeweiligen Nutzers.
Sieht der Besitzer meine Chats?
Er sieht, was jeder Modellbetreiber sieht: dass angefragt wird, mit welchem Modell und wann. Die Inhalte laufen durch seinen Ollama-Server — teile nichts Vertrauliches über einen fremden Server.
Kostet die Freigabe den Besitzer etwas?
Nur Strom und Rechenzeit. Solange jemand über den Server schreibt, ist dessen Grafikkarte beschäftigt.
Sicherheit
🔓 Ollama kennt keine Passwörter
Wer den Port erreicht, darf den Server benutzen. Das ist beim Öffnen ins Netzwerk der wichtigste Punkt.
🏠 Nur öffnen, wenn nötig
Im Einzelplatzbetrieb bleibt 127.0.0.1 die sicherste Wahl.
🚫 Niemals im Router freigeben
Für den Zugriff von unterwegs ist Tailscale oder ein VPN der richtige Weg — dort kommen nur deine eigenen Geräte hinein.
🔐 Öffentlich nur mit Proxy
Einen Reverse-Proxy mit HTTPS und Passwortschutz davorsetzen und in Jon https als Protokoll wählen.
🙈 Deine Texte bleiben bei dir
Die Gespräche laufen zwischen Jon und deinem Ollama-Server. Kein Anbieter bekommt sie zu sehen.
Tipps zur optimalen Nutzung
⏱️ Keep Alive hochsetzen
Mit 30m bleibt das Modell geladen und die erste Antwort kommt sofort statt nach Ladezeit.
🧠 Context Length nur so groß wie nötig
4096 reicht für normale Gespräche; 32768 belegt ein Vielfaches an Speicher.
👨💻 Zum Programmieren
Ein Coder-Modell wählen wie qwen2.5-coder und die Temperatur auf 0.2 senken.
🎯 Reproduzierbare Antworten
Einen festen Seed setzen und die Temperatur auf 0 stellen.
🖥️ Zwei Rechner nutzen
Ollama auf der Maschine mit der starken Grafikkarte, Jon auf dem Laptop — über LAN oder Tailscale.
🔁 Anbieter wechseln beachten
Wer strikt lokal bleiben will, schaltet die Ausweich-Automatik im Zahnrad-Menü unter Jon aus.