Anmelden
Einsteiger 22:57 20 Min, um LM Studio oder Ollama einzurichten und ein erstes Modell zu laden

Zwei Fragen entscheiden, was auf deinen eigenen Rechner gehört

Personalakten, Gesprächsprotokolle, Verträge: Genau die Dokumente, bei denen KI am meisten helfen würde, lädt kaum jemand hoch. Zwei Fragen und eine Faustregel sortieren jeden Vorgang, und du siehst in einer Minute, welches Modell deine Maschine trägt.

Jannis Gerlinger18. August 2026

Die Entscheidungshilfe zum Durchblättern

Alle zwölf Seiten direkt hier: die zwei Fragen, was lokal läuft und was nicht, die Faustregel für deine Grafikkarte, die Modelle und die Werkzeuge.

Seite 1 von 12
Seite 1 von 12

Was lokal läuft und was ein großes Modell braucht

Läuft auf deinem Rechner

  • Gespräche und Besprechungen zusammenfassen
  • Dokumente auswerten und Kernaussagen ziehen
  • Namen, Beträge und Termine aus Fließtext in eine Tabelle holen
  • Entwürfe umformulieren, kürzen oder im Ton ändern
  • Übersetzen
  • Mails und Dokumente nach Thema vorsortieren

Das Muster: Lokal läuft, was mit dem Text arbeitet, der schon vor dir liegt.

Braucht ein großes Modell aus der Cloud

  • Agentic Coding, wo viele Schritte selbst geplant werden
  • Ein 200-Seiten-Vertrag am Stück
  • Recherche zu dieser Woche

Zu komplex, zu lang, zu aktuell: an diesen drei Stellen bleibt die Cloud vorn.

Das Wichtigste in Kürze

Am Ende hast du

Du weißt bei jedem Vorgang in deinem Unternehmen, ob er auf den eigenen Rechner gehört oder in die Cloud darf, und welches Modell auf deine Hardware passt

Du brauchst

  • Kein Vorwissen. Wer mitmachen will, braucht einen Rechner mit Grafikkarte oder einen Mac mit Apple Silicon
  • Eine Liste der Vorgänge, bei denen dich der Datenschutz bisher ausgebremst hat
ca. 20 Min, um LM Studio oder Ollama einzurichten und ein erstes Modell zu laden Umsetzung Stufe: Einsteiger

Worum es geht

Die Aufgaben, bei denen KI im Mittelstand am meisten bringen würde, sind ausgerechnet die, bei denen niemand die Daten hochladen will. Personalakten, Gesprächsprotokolle, Kalkulationen, Verträge. Zu Recht.

Seit ein paar Monaten ist das kein Widerspruch mehr. Offene Modelle sind so weit, dass ein Rechner mit einer normalen Grafikkarte echte Büroarbeit erledigt, ohne dass ein einziges Byte das Haus verlässt. Die Frage ist nur: welche Arbeit, und auf welcher Maschine.

Eins vorweg, weil es wichtig ist: Alle Demo-Daten im Video sind erfunden, es gibt keine echten Kundennamen. Und ich bin kein Anwalt. Was Lizenzen und Datenschutz angeht, ist das hier meine technische Einordnung aus der Praxis, keine Rechtsberatung.

Die zwei Fragen

Es braucht keine Richtlinie und kein Datenschutzkonzept, um zu entscheiden, wohin ein Vorgang gehört. Zwei Fragen reichen:

Steht ein echter Name drin? Also ein Name, der zu einer realen Person gehört: Mitarbeiter, Kunden, Bewerber. Eine Bewerbungsmappe fällt darunter, eine Krankmeldung auch, ein Gesprächsprotokoll mit Namen ebenso.

Schadet es, wenn es rausgeht? Das ist Betriebswissen ohne jeden Personennamen, das trotzdem nicht nach draußen gehört: deine Kalkulationsgrundlage, eine Rezeptur, eine Konstruktionszeichnung.

Ist eine der beiden Antworten ja, gehört der Vorgang auf den eigenen Rechner oder zu einem Anbieter mit Sitz in Europa. Sind beide nein, nimm das beste Modell, das du bekommen kannst. Da bremst dich Vorsicht nur aus.

Was lokal läuft und was nicht

Lokal läuft alles, was mit dem Text arbeitet, der vor dir liegt:

  • Gespräche und Besprechungen zusammenfassen
  • Dokumente auswerten und Kernaussagen ziehen
  • Namen, Beträge und Termine aus Fließtext in eine Tabelle holen
  • Entwürfe umformulieren
  • Übersetzen

Ein großes Modell brauchst du in drei Fällen. Zu komplex: Agentic Coding, wo viele Schritte selbst geplant werden. Zu lang: ein 200-Seiten-Vertrag am Stück, der nicht mehr ins Kontextfenster passt. Zu aktuell: Recherche zu dieser Woche, die nach dem Trainingsstand des Modells liegt.

Die Faustregel

Ob ein Modell auf deine Karte passt, rechnest du in zehn Sekunden aus:

Milliarden Parameter mal 0,7, plus 3 GB. Das Ergebnis muss unter deinen Grafikspeicher passen. Am Mac zählt stattdessen der Arbeitsspeicher.

Ein Modell mit 12 Milliarden Parametern belegt also rund 11,4 GB und passt damit auf eine 12-GB-Karte. Eine Falle gibt es dabei: Bei manchen Modellen stehen zwei Zahlen nebeneinander. Für den Speicherbedarf zählt immer die große. Die kleine sagt nur, wie viel davon gleichzeitig rechnet, nicht wie viel geladen sein muss.

Wie viel Speicher deine Grafikkarte hat

Damit du die Faustregel gleich anwenden kannst, hier die aktuellen Karten mit ihrem Speicher.

Nvidia GeForce RTX 50: RTX 5090 mit 32 GB, RTX 5080 und RTX 5070 Ti mit 16 GB, RTX 5070 mit 12 GB, RTX 5060 und RTX 5060 Ti mit 8 GB, die 5060 Ti auch als 16-GB-Fassung.

AMD Radeon RX 9000: RX 9070 XT mit 16 GB, RX 9060 XT wahlweise mit 8 oder 16 GB. Das läuft, kostet aber Bastelei. Im Ollama-Projekt stehen dazu über 30 offene Fehlermeldungen, Nvidia ist der ruhigere Weg.

Mac mit Apple Silicon: Hier gibt es keinen eigenen Grafikspeicher, Prozessor und Grafik teilen sich den Arbeitsspeicher. Rechne mit rund zwei Dritteln des verbauten Speichers. Bei 32 GB im Gerät sind das etwa 21 GB für das Modell.

Der Bereich, in dem du landen willst, sind 12 bis 16 GB. Damit läuft die Klasse, die im Büro die Arbeit macht. Nach oben ist die Grenze die RTX Pro 6000 mit 96 GB, die kostet allerdings gut 13.000 Dollar und ist für Büroarbeit vollkommen unnötig.

Welche Modelle es gibt

Sechs Familien bestimmen das Feld. Zwei davon reichen für den Anfang.

  • Gemma von Google. Büroarbeit, Text und Bild, seit Gemma 4 unter Apache 2.0. Die Fassung mit 12 Milliarden Parametern belegt 7,6 GB und ist der Standardfall.
  • Qwen von Alibaba. Der Allrounder, von 0,8 bis 122 Milliarden Parametern. Die 9-Milliarden-Fassung belegt 6,6 GB, die mit 4 Milliarden nur 3,4 GB.
  • Llama von Meta. Am längsten dabei, läuft in jedem Werkzeug, größte Auswahl an Anleitungen.
  • Mistral aus Frankreich. Schlank und schnell, wird gern für Code genommen.
  • DeepSeek. Stark im Schlussfolgern, die großen Fassungen sprengen aber jede normale Karte.
  • Phi von Microsoft. Bewusst klein gebaut, für schwache Hardware.

Ein Hinweis zu Ollama: Die dortige Fassung eines Modells ist nicht immer das Original. Gemma 4 kann eigentlich auch Bilder, die Ollama-Fassung der 12-Milliarden-Variante kann nur Text, obwohl anderes drangeschrieben steht.

Womit du es betreibst

Es gibt mehr als einen Weg, und sie unterscheiden sich vor allem darin, wie viel du selbst einrichten willst.

Zum Anfangen: LM Studio ist der einfachste Einstieg, eine fertige Oberfläche, Modelle lädst du per Klick. GPT4All ist eine reine Desktop-Anwendung ohne Terminal. Jan sieht aus wie ChatGPT, ist quelloffen und läuft lokal.

Wenn es im Betrieb bleiben soll: Ollama ist der Standard im Hintergrund, es läuft als Dienst und andere Programme docken an. Open WebUI setzt die Oberfläche davor, auch für mehrere Mitarbeiter im Netz. AnythingLLM ist für eigene Dokumente gebaut: einlesen, durchsuchen, befragen.

Der Unterbau: llama.cpp ist die Maschine unter fast allen anderen, MLX ist auf dem Mac deutlich schneller als der Standardweg. Beides brauchst du nur, wenn du das Letzte aus der Hardware holen willst.

Mein Vorschlag: Fang mit LM Studio an und probier ein Modell aus. Soll es dauerhaft laufen, nimm Ollama dahinter und Open WebUI davor.

Wenn du keine eigene Hardware willst

Es gibt Anbieter, die offene Modelle für dich betreiben. Entscheidend ist dabei nicht, wo der Server steht, sondern wo das Unternehmen seinen Sitz hat. Danach richtet sich, welchem Recht es unterliegt.

Groq und Together AI sitzen in den USA und unterliegen US-Recht. Nebius sitzt in den Niederlanden und damit im europäischen Rechtsraum.

Die wichtigste Erkenntnis

Die Grenze verläuft nicht zwischen wichtig und unwichtig, sondern zwischen den Daten, die dein Haus verlassen dürfen, und denen, die es nicht dürfen. Sobald du das einmal sauber getrennt hast, kannst du für alles andere ohne schlechtes Gewissen das stärkste Modell nehmen.

Die Entscheidungshilfe liegt hier als PDF zum Herunterladen: zwölf Seiten mit beiden Fragen, der Liste was lokal läuft, der Faustregel, den Grafikkarten, den Modell-Familien und den Werkzeugen.

Kostenlos im Lab weiterlesen

Die restlichen Schritte Schritte, alle Prompts und die Dateien zu diesem Tutorial gibt es kostenlos für Mitglieder.

  • Die komplette Schritt-für-Schritt-Anleitung
  • 1 Dateien und Vorlagen
  • Fragen stellen und mitreden im Stammtisch
Ich bin schon Mitglied
Kostenlos, ohne Kreditkarte. Dein Konto kannst du jederzeit selbst löschen.

Keine Zeit zum Nachbauen?

Ich setze die Lösung für dich um oder schule dich und dein Team. Im kostenlosen Erstgespräch klären wir, was passt.

Weiter lernen

Alle Tutorials