NEU 3.37.2 🤝 Serverfreigabe: deinen Ollama-Server per Code für andere Jon-Nutzer freigeben

Jon mit Ollama
ganz ohne Cloud

Kostenlos, privat, offline: Jon lässt seine Antworten auf deiner eigenen Hardware rechnen. Der Ollama-Server darf auf diesem PC laufen, auf einem zweiten Rechner im Heimnetz oder über Tailscale ganz woanders.

Was ist Ollama?

Ollama ist ein kleines, kostenloses Programm, das große Sprachmodelle direkt auf deiner eigenen Hardware ausführt. Du lädst ein Modell einmal herunter und kannst es danach beliebig oft benutzen.

💸 Kostenlos

Keine Token-Abrechnung, kein Abo, kein Limit. Du zahlst nur den Strom.

🔒 Privat

Kein Wort verlässt deinen Rechner oder dein Netzwerk. Kein Anbieter liest mit.

✈️ Offline

Ist das Modell einmal geladen, funktioniert Jon auch ohne Internet.

Der Preis dafür: Es rechnet deine Grafikkarte statt eines Rechenzentrums. Kleine Modelle sind blitzschnell, große brauchen entsprechend Speicher.

Voraussetzungen

MinimumEmpfohlen
Arbeitsspeicher8 GB16 GB und mehr
Grafikspeicherkeiner (läuft auf der CPU)8 GB VRAM und mehr
Festplatte2 GB je kleinem Modell20 GB und mehr
SystemWindows 10/11, macOS, Linux

Faustregel: Ein Modell braucht ungefähr so viel Speicher, wie seine Datei groß ist. Ein 3B-Modell passt fast überall, ein 70B-Modell braucht eine dicke Grafikkarte.

Installation

1

Ollama herunterladen

Von ollama.com/download, Installer starten — fertig. Ollama läuft danach im Hintergrund auf Port 11434.

2

Erstes Modell laden

ollama pull llama3.2
3

Kurz prüfen

Kommt hier eine Versionsnummer zurück, ist alles bereit:

curl http://127.0.0.1:11434/api/version

Einrichtung in Jon

1

Einstellungen öffnen

Jon starten, dann Zahnrad-Menü oben rechts und weiter zum Bereich Ollama.

2

Ollama einschalten

Schalter Ollama verwenden auf an, dann Server & Modelle … öffnen.

3

Verbinden und Modell wählen

Verbindung testen drücken — steht oben Online, hat es geklappt. Modell auswählen, Speichern, oben im Chat als Anbieter ollama wählen.

Alle Einstellungen landen in data/ollama.json und werden beim Start automatisch geladen.

Server konfigurieren

Läuft Ollama auf demselben PC wie Jon, musst du nichts einstellen — 127.0.0.1:11434 ist die Voreinstellung.

Soll Ollama von anderen Geräten erreichbar sein, muss der Server auf allen Netzwerkkarten lauschen. Das stellst du auf dem Ollama-Rechner ein:

W

Windows

In PowerShell, danach Ollama neu starten:

setx OLLAMA_HOST 0.0.0.0
L

macOS / Linux

export OLLAMA_HOST=0.0.0.0

Als systemd-Dienst gehört es in /etc/systemd/system/ollama.service.d/override.conf unter [Service] als Environment="OLLAMA_HOST=0.0.0.0". Danach systemctl daemon-reload und systemctl restart ollama.

Port konfigurieren

Standard ist 11434. Einen anderen Port setzt du auf dem Server über OLLAMA_HOST=0.0.0.0:11500 und trägst ihn in Jon im Feld Port ein.

🛡️

Firewall nicht vergessen

Unter Windows auf dem Ollama-Rechner:

netsh advfirewall firewall add rule name="Ollama" dir=in action=allow protocol=TCP localport=11434

Host konfigurieren

Im Ollama-Fenster beschreiben mehrere Felder dieselbe Sache — nimm, was dir lieber ist:

FeldBeispielBedeutung
Server-URLhttp://192.168.1.50:11434Komplette Adresse auf einmal
Host / IP192.168.1.50Nur der Rechner
Port11434Nur die Nummer
Protokollhttp oder httpsFür eigene Server hinter einem Proxy

Tippst du oben eine vollständige URL ein, füllen sich Host, Port und Protokoll von selbst — und umgekehrt. Darunter schlägt Jon die Adressen dieses PCs zum Anklicken vor: localhost, Heimnetz (LAN) und Tailscale.

Verbindung von Jon zum Server

SzenarioHostPort
Ollama auf demselben PC127.0.0.111434
Anderer PC im Heimnetz192.168.x.x oder 10.x.x.x11434
Rechner über Tailscale100.x.x.x11434
Eigener Server mit HTTPSollama.meinedomain.de mit https443

Nutzung über LAN

1

Server öffnen

Auf dem Ollama-Rechner OLLAMA_HOST=0.0.0.0 setzen und Ollama neu starten.

2

IP-Adresse herausfinden

Windows: ipconfig · macOS und Linux: ip addr

3

Firewall freigeben

Port 11434 für eingehende TCP-Verbindungen erlauben.

4

In Jon eintragen

Host und Port ins Ollama-Fenster, dann Verbindung testen drücken.

Nutzung über Tailscale

Tailscale verbindet deine Geräte verschlüsselt, egal wo sie stehen — ohne eine einzige Portfreigabe im Router.

1

Auf beiden Geräten installieren

Mit demselben Konto anmelden.

2

Ollama öffnen

Auf dem Ollama-Rechner OLLAMA_HOST=0.0.0.0 setzen.

3

Tailscale-Adresse ablesen

Sie beginnt mit 100.:

tailscale ip -4
4

In Jon eintragen

Adresse als Host, Port 11434. Damit läuft das Modell zu Hause auf der großen Grafikkarte, während Jon unterwegs auf dem Laptop damit arbeitet.

Verbindung testen

Der Knopf Verbindung testen speichert deine Serverdaten und fragt den Server sofort ab. Oben im Fenster steht danach jederzeit:

Onlinehttp://192.168.1.50:11434
Antwortzeit12 ms
Ollama-Version0.12.0
Gewähltes Modellllama3.2
Installierte Modelle4
Letzte Verbindung02.08.2026, 20:41

Der Status aktualisiert sich alle 15 Sekunden von selbst; Status aktualisieren fragt sofort nach. Mögliche Zustände: Online, Offline, Verbinde … und Ausgeschaltet.

Modelle installieren

Modelle werden immer auf dem Server installiert, nicht in Jon:

📦

Im Terminal des Ollama-Rechners

ollama pull llama3.2 ollama pull qwen2.5-coder:7b ollama list

Danach in Jon auf Neu laden klicken — die Liste kommt frisch vom Server.

ModellGrößeWofür
llama3.2~2 GBAllrounder, läuft fast überall
qwen2.5-coder:7b~4,7 GBProgrammieren
mistral~4,1 GBSchnelle Alltagsantworten
llama3.3:70b~40 GBSehr stark, braucht viel VRAM

Modelle wechseln

Zwei Wege, gleiches Ergebnis: im Ollama-Fenster unter Modell auswählen und speichern — oder oben im Chat den Anbieter ollama wählen und daneben das Modell. Jon hält beide Stellen synchron.

Nicht jedes lokale Modell kann Werkzeuge aufrufen. Meldet der Server does not support tools, wiederholt Jon die Anfrage automatisch ohne Werkzeuge und antwortet trotzdem. Werkzeuge beherrschen zum Beispiel llama3.1, llama3.3, qwen2.5 und mistral-nemo.

Server für andere freigeben

Läuft auf deinem Rechner eine starke Grafikkarte, kannst du deinen Ollama-Server für andere Jon-Nutzer freigeben. Sie chatten dann über dein Modell, ohne selbst etwas zu installieren — und ohne Zugriff auf irgendetwas anderes auf deinem PC.

Freigeben (als Besitzer)

1

Bereich öffnen

Zahnrad-Menü → Ollama → Server & Modelle …, dort ganz unten Serverfreigabe.

2

Einschalten und beschreiben

Schalter Meinen Ollama-Server freigeben an, dann Freigabename und Beschreibung eintragen — das sehen die anderen.

3

Sichtbarkeit wählen

Privat, Nur Eingeladene oder Öffentlich (siehe Tabelle unten).

4

Code weitergeben

Der Code sieht aus wie AB39KD12, der Link wie jon://ollama/AB39KD12@192.168.1.50:8758. Beides gibt es auf Klick in die Zwischenablage.

SichtbarkeitBedeutung
PrivatNiemand kommt neu herein. Bereits verbundene Benutzer behalten ihren Zugang, bis du ihn widerrufst.
Nur EingeladeneNur wer eine persönliche Einladung von dir hat. Jede Einladung gilt für genau einen Benutzer und verfällt nach der ersten Nutzung.
ÖffentlichJeder mit deinem Freigabecode darf sich verbinden.

Verbinden (als Gast)

1

Code eintragen

Im selben Fenster unter Freigegebene Server nutzen den Code oder Link einfügen und auf Verbinden klicken.

2

Modell wählen

Die Modelle des fremden Servers stehen sofort oben in der KI-Auswahl beim Anbieter ollama, gruppiert unter „Freigabe <Code>".

3

Ganz normal chatten

Verlauf, Streaming und deine eigenen Ollama-Einstellungen (Temperatur, Top P, Top K, Max Tokens, Context Length, Keep Alive, Seed, System Prompt, Timeout) gelten weiter.

Im Heimnetz genügt der Code allein — Jon sucht den Server im Netzwerk. Über Tailscale oder von außerhalb nimmt man den Link mit Adresse.

Verwalten

Unter Verbundene Benutzer siehst du zu jedem Gast Name und Adresse, den Verbindungsstatus, das gerade genutzte Modell, Sitzungen und Anfragen sowie die letzte Aktivität:

Annaaktivllama3.2
Jonasverbundenqwen2.5-coder
Lenaofflinevor 2 Std.

entfernen wirft einen einzelnen Benutzer hinaus, Allen Zugriff entziehen alle auf einmal. Beides gilt sofort — auch mitten in einer laufenden Antwort. Mit Neuen Code erzeugen wird der alte Freigabecode ungültig.

Sicherheit der Freigabe

🎫 Nichts ist offen zugänglich

Jeder Gast bekommt beim Beitritt ein eigenes Zugriffstoken mit 256 Bit. Ohne gültiges Token beantwortet Jon keine einzige Anfrage — auch nicht bei öffentlicher Sichtbarkeit.

🔑 Tokens nur als Hash

Gespeichert wird ausschließlich ein SHA-256-Hash, verglichen wird zeitkonstant.

🚪 Nur das Modell

Freigegeben ist allein das Antworten deines Ollama-Servers. Chats, Dateien, Werkzeuge und PC-Steuerung bleiben unerreichbar — die Werkzeuge des Gastes laufen auf seinem eigenen Rechner.

🧱 Getrennter Port

Die Freigabe hängt am Chat-Port 8758, nicht an Jons Steuer-API auf 127.0.0.1:8756.

⏱️ Bremse gegen Raten

Zu viele Fehlversuche in Folge werden pro Adresse ausgebremst.

🧠 Dein Speicher bleibt deiner

Die Sampling-Werte des Gastes gelten, aber Context Length und Max Tokens werden auf deine eigenen Einstellungen gedeckelt — dein Keep Alive bleibt gültig.

🛑 Aus heißt aus

Schaltest du die Freigabe ab, sind alle Tokens augenblicklich ungültig.

Gib den Port trotzdem nicht im Router nach außen frei. Für Freunde außerhalb deines Heimnetzes ist Tailscale der richtige Weg. Damit Gäste dich im Heimnetz finden, muss TCP 8758 offen sein, für die Suche allein per Code zusätzlich UDP 8762.

Alle Einstellungen

EinstellungBedeutungStandard
Ollama verwendenSchaltet Ollama als Anbieter an und ausan
Server-URL, Host, Port, ProtokollWo der Server läufthttp://127.0.0.1:11434
ModellDas Modell, mit dem Jon antwortet
Modelle automatisch ladenModell-Liste selbstständig vom Server holenan
Temperatur0 ist nüchtern, 2 ist sehr kreativ0.7
Top PAnteil der berücksichtigten Wortwahrscheinlichkeiten0.9
Top KWie viele Wortkandidaten pro Schritt betrachtet werden40
Max TokensMaximale Länge der Antwort, -1 bedeutet ohne Limit32768
Context LengthGröße des Gedächtnisfensters4096
Keep AliveWie lange das Modell im Speicher bleibt5m
SeedFeste Zahl bedeutet reproduzierbare Antworten, -1 ist zufällig-1
System PromptZusatzanweisung für jedes Ollama-Gesprächleer
StreamingAntwort live mitschreiben statt am Stückan
TimeoutWie lange Jon auf eine Antwort wartet, in Sekunden120
Automatisch neu verbindenBei Abbruch bis zu dreimal erneut versuchenan

Keep Alive versteht 5m, 30s, 1h, 0 für sofortiges Entladen und -1 für dauerhaft geladen. Eine größere Context Length kostet spürbar Speicher.

Fehlerbehebung

MeldungUrsacheLösung
Keine Verbindung zu Ollama unter …Server läuft nicht oder falsche AdresseOllama starten, Host und Port prüfen
… antwortet nichtFirewall blockt oder OLLAMA_HOST fehltOLLAMA_HOST=0.0.0.0 setzen, Port freigeben
Das Modell X ist nicht installiertModell fehlt auf dem Serverollama pull X auf dem Server
Ollama hat zu lange gebrauchtModell zu groß für die HardwareTimeout erhöhen oder kleineres Modell nehmen
… passt nicht in den SpeicherZu wenig RAM oder VRAMKleineres Modell oder Context Length senken
Ollama ist ausgeschaltetDer Schalter steht auf ausZahnrad-Menü, Bereich Ollama, einschalten
Keine Modelle in der ListeNoch keins installiertollama pull llama3.2, dann Neu laden
Kein Server mit diesem Code im Netzwerk gefundenFreigabe aus, anderes Netz oder UDP 8762 zuEinladungslink mit Adresse nehmen: CODE@ip:8758
Der Zugriff wurde widerrufenBesitzer hat dich entfernt oder die Freigabe abgeschaltetNeuen Freigabecode erfragen
Diese Einladung wurde bereits verwendetEinladungen gelten einmaligNeue Einladung erstellen lassen

Jon stürzt in keinem dieser Fälle ab: Die Meldung erscheint als Text, und nach der Korrektur genügt Verbindung testen.

FAQ

Kostet Ollama etwas?

Nein. Programm und Modelle sind kostenlos, es gibt keine Token-Abrechnung.

Braucht Jon dann noch einen API-Schlüssel?

Für Ollama nicht. Alle anderen Anbieter funktionieren unverändert weiter.

Muss ich online sein?

Nur zum Herunterladen der Modelle. Danach läuft alles offline.

Ollama und Cloud parallel?

Ja. Der Anbieter oben im Chat ist jederzeit umschaltbar; Mini Jon und Telegram dürfen ein anderes Modell nutzen.

Warum ist es langsamer als die Cloud?

Weil es auf deiner Hardware rechnet. Kleine Modelle von 1B bis 8B sind auf einer normalen Grafikkarte trotzdem sehr flott.

Kann Jon Bilder ansehen?

Ja, mit einem Vision-Modell wie llava oder llama3.2-vision.

Wo liegen meine Einstellungen?

In data/ollama.json. Das Backup im Zahnrad-Menü nimmt sie mit.

Welche Schnittstelle nutzt Jon?

Die offizielle Ollama-API: /api/chat, /api/tags und /api/version.

Kann jemand über meine Freigabe meinen PC steuern?

Nein. Freigegeben ist nur das Antworten des Modells. Werkzeuge, Dateien und PC-Steuerung laufen immer auf dem Rechner des jeweiligen Nutzers.

Sieht der Besitzer meine Chats?

Er sieht, was jeder Modellbetreiber sieht: dass angefragt wird, mit welchem Modell und wann. Die Inhalte laufen durch seinen Ollama-Server — teile nichts Vertrauliches über einen fremden Server.

Kostet die Freigabe den Besitzer etwas?

Nur Strom und Rechenzeit. Solange jemand über den Server schreibt, ist dessen Grafikkarte beschäftigt.

Sicherheit

🔓 Ollama kennt keine Passwörter

Wer den Port erreicht, darf den Server benutzen. Das ist beim Öffnen ins Netzwerk der wichtigste Punkt.

🏠 Nur öffnen, wenn nötig

Im Einzelplatzbetrieb bleibt 127.0.0.1 die sicherste Wahl.

🚫 Niemals im Router freigeben

Für den Zugriff von unterwegs ist Tailscale oder ein VPN der richtige Weg — dort kommen nur deine eigenen Geräte hinein.

🔐 Öffentlich nur mit Proxy

Einen Reverse-Proxy mit HTTPS und Passwortschutz davorsetzen und in Jon https als Protokoll wählen.

🙈 Deine Texte bleiben bei dir

Die Gespräche laufen zwischen Jon und deinem Ollama-Server. Kein Anbieter bekommt sie zu sehen.

Tipps zur optimalen Nutzung

⏱️ Keep Alive hochsetzen

Mit 30m bleibt das Modell geladen und die erste Antwort kommt sofort statt nach Ladezeit.

🧠 Context Length nur so groß wie nötig

4096 reicht für normale Gespräche; 32768 belegt ein Vielfaches an Speicher.

👨‍💻 Zum Programmieren

Ein Coder-Modell wählen wie qwen2.5-coder und die Temperatur auf 0.2 senken.

🎯 Reproduzierbare Antworten

Einen festen Seed setzen und die Temperatur auf 0 stellen.

🖥️ Zwei Rechner nutzen

Ollama auf der Maschine mit der starken Grafikkarte, Jon auf dem Laptop — über LAN oder Tailscale.

🔁 Anbieter wechseln beachten

Wer strikt lokal bleiben will, schaltet die Ausweich-Automatik im Zahnrad-Menü unter Jon aus.