Die Entscheidungshilfe zum Durchblättern
Alle zwölf Seiten direkt hier: die zwei Fragen, was lokal läuft und was nicht, die Faustregel für deine Grafikkarte, die Modelle und die Werkzeuge.
Was lokal läuft und was ein großes Modell braucht
Läuft auf deinem Rechner
- Gespräche und Besprechungen zusammenfassen
- Dokumente auswerten und Kernaussagen ziehen
- Namen, Beträge und Termine aus Fließtext in eine Tabelle holen
- Entwürfe umformulieren, kürzen oder im Ton ändern
- Übersetzen
- Mails und Dokumente nach Thema vorsortieren
Das Muster: Lokal läuft, was mit dem Text arbeitet, der schon vor dir liegt.
Braucht ein großes Modell aus der Cloud
- Agentic Coding, wo viele Schritte selbst geplant werden
- Ein 200-Seiten-Vertrag am Stück
- Recherche zu dieser Woche
Zu komplex, zu lang, zu aktuell: an diesen drei Stellen bleibt die Cloud vorn.
Das Wichtigste in Kürze
Am Ende hast du
Du weißt bei jedem Vorgang in deinem Unternehmen, ob er auf den eigenen Rechner gehört oder in die Cloud darf, und welches Modell auf deine Hardware passt
Du brauchst
- Kein Vorwissen. Wer mitmachen will, braucht einen Rechner mit Grafikkarte oder einen Mac mit Apple Silicon
- Eine Liste der Vorgänge, bei denen dich der Datenschutz bisher ausgebremst hat
Worum es geht
Die Aufgaben, bei denen KI im Mittelstand am meisten bringen würde, sind ausgerechnet die, bei denen niemand die Daten hochladen will. Personalakten, Gesprächsprotokolle, Kalkulationen, Verträge. Zu Recht.
Seit ein paar Monaten ist das kein Widerspruch mehr. Offene Modelle sind so weit, dass ein Rechner mit einer normalen Grafikkarte echte Büroarbeit erledigt, ohne dass ein einziges Byte das Haus verlässt. Die Frage ist nur: welche Arbeit, und auf welcher Maschine.
Eins vorweg, weil es wichtig ist: Alle Demo-Daten im Video sind erfunden, es gibt keine echten Kundennamen. Und ich bin kein Anwalt. Was Lizenzen und Datenschutz angeht, ist das hier meine technische Einordnung aus der Praxis, keine Rechtsberatung.
Die zwei Fragen
Es braucht keine Richtlinie und kein Datenschutzkonzept, um zu entscheiden, wohin ein Vorgang gehört. Zwei Fragen reichen:
Steht ein echter Name drin? Also ein Name, der zu einer realen Person gehört: Mitarbeiter, Kunden, Bewerber. Eine Bewerbungsmappe fällt darunter, eine Krankmeldung auch, ein Gesprächsprotokoll mit Namen ebenso.
Schadet es, wenn es rausgeht? Das ist Betriebswissen ohne jeden Personennamen, das trotzdem nicht nach draußen gehört: deine Kalkulationsgrundlage, eine Rezeptur, eine Konstruktionszeichnung.
Ist eine der beiden Antworten ja, gehört der Vorgang auf den eigenen Rechner oder zu einem Anbieter mit Sitz in Europa. Sind beide nein, nimm das beste Modell, das du bekommen kannst. Da bremst dich Vorsicht nur aus.
Was lokal läuft und was nicht
Lokal läuft alles, was mit dem Text arbeitet, der vor dir liegt:
- Gespräche und Besprechungen zusammenfassen
- Dokumente auswerten und Kernaussagen ziehen
- Namen, Beträge und Termine aus Fließtext in eine Tabelle holen
- Entwürfe umformulieren
- Übersetzen
Ein großes Modell brauchst du in drei Fällen. Zu komplex: Agentic Coding, wo viele Schritte selbst geplant werden. Zu lang: ein 200-Seiten-Vertrag am Stück, der nicht mehr ins Kontextfenster passt. Zu aktuell: Recherche zu dieser Woche, die nach dem Trainingsstand des Modells liegt.
Die Faustregel
Ob ein Modell auf deine Karte passt, rechnest du in zehn Sekunden aus:
Milliarden Parameter mal 0,7, plus 3 GB. Das Ergebnis muss unter deinen Grafikspeicher passen. Am Mac zählt stattdessen der Arbeitsspeicher.
Ein Modell mit 12 Milliarden Parametern belegt also rund 11,4 GB und passt damit auf eine 12-GB-Karte. Eine Falle gibt es dabei: Bei manchen Modellen stehen zwei Zahlen nebeneinander. Für den Speicherbedarf zählt immer die große. Die kleine sagt nur, wie viel davon gleichzeitig rechnet, nicht wie viel geladen sein muss.
Wie viel Speicher deine Grafikkarte hat
Damit du die Faustregel gleich anwenden kannst, hier die aktuellen Karten mit ihrem Speicher.
Nvidia GeForce RTX 50: RTX 5090 mit 32 GB, RTX 5080 und RTX 5070 Ti mit 16 GB, RTX 5070 mit 12 GB, RTX 5060 und RTX 5060 Ti mit 8 GB, die 5060 Ti auch als 16-GB-Fassung.
AMD Radeon RX 9000: RX 9070 XT mit 16 GB, RX 9060 XT wahlweise mit 8 oder 16 GB. Das läuft, kostet aber Bastelei. Im Ollama-Projekt stehen dazu über 30 offene Fehlermeldungen, Nvidia ist der ruhigere Weg.
Mac mit Apple Silicon: Hier gibt es keinen eigenen Grafikspeicher, Prozessor und Grafik teilen sich den Arbeitsspeicher. Rechne mit rund zwei Dritteln des verbauten Speichers. Bei 32 GB im Gerät sind das etwa 21 GB für das Modell.
Der Bereich, in dem du landen willst, sind 12 bis 16 GB. Damit läuft die Klasse, die im Büro die Arbeit macht. Nach oben ist die Grenze die RTX Pro 6000 mit 96 GB, die kostet allerdings gut 13.000 Dollar und ist für Büroarbeit vollkommen unnötig.
Welche Modelle es gibt
Sechs Familien bestimmen das Feld. Zwei davon reichen für den Anfang.
- Gemma von Google. Büroarbeit, Text und Bild, seit Gemma 4 unter Apache 2.0. Die Fassung mit 12 Milliarden Parametern belegt 7,6 GB und ist der Standardfall.
- Qwen von Alibaba. Der Allrounder, von 0,8 bis 122 Milliarden Parametern. Die 9-Milliarden-Fassung belegt 6,6 GB, die mit 4 Milliarden nur 3,4 GB.
- Llama von Meta. Am längsten dabei, läuft in jedem Werkzeug, größte Auswahl an Anleitungen.
- Mistral aus Frankreich. Schlank und schnell, wird gern für Code genommen.
- DeepSeek. Stark im Schlussfolgern, die großen Fassungen sprengen aber jede normale Karte.
- Phi von Microsoft. Bewusst klein gebaut, für schwache Hardware.
Ein Hinweis zu Ollama: Die dortige Fassung eines Modells ist nicht immer das Original. Gemma 4 kann eigentlich auch Bilder, die Ollama-Fassung der 12-Milliarden-Variante kann nur Text, obwohl anderes drangeschrieben steht.
Womit du es betreibst
Es gibt mehr als einen Weg, und sie unterscheiden sich vor allem darin, wie viel du selbst einrichten willst.
Zum Anfangen: LM Studio ist der einfachste Einstieg, eine fertige Oberfläche, Modelle lädst du per Klick. GPT4All ist eine reine Desktop-Anwendung ohne Terminal. Jan sieht aus wie ChatGPT, ist quelloffen und läuft lokal.
Wenn es im Betrieb bleiben soll: Ollama ist der Standard im Hintergrund, es läuft als Dienst und andere Programme docken an. Open WebUI setzt die Oberfläche davor, auch für mehrere Mitarbeiter im Netz. AnythingLLM ist für eigene Dokumente gebaut: einlesen, durchsuchen, befragen.
Der Unterbau: llama.cpp ist die Maschine unter fast allen anderen, MLX ist auf dem Mac deutlich schneller als der Standardweg. Beides brauchst du nur, wenn du das Letzte aus der Hardware holen willst.
Mein Vorschlag: Fang mit LM Studio an und probier ein Modell aus. Soll es dauerhaft laufen, nimm Ollama dahinter und Open WebUI davor.
Wenn du keine eigene Hardware willst
Es gibt Anbieter, die offene Modelle für dich betreiben. Entscheidend ist dabei nicht, wo der Server steht, sondern wo das Unternehmen seinen Sitz hat. Danach richtet sich, welchem Recht es unterliegt.
Groq und Together AI sitzen in den USA und unterliegen US-Recht. Nebius sitzt in den Niederlanden und damit im europäischen Rechtsraum.
Die wichtigste Erkenntnis
Die Grenze verläuft nicht zwischen wichtig und unwichtig, sondern zwischen den Daten, die dein Haus verlassen dürfen, und denen, die es nicht dürfen. Sobald du das einmal sauber getrennt hast, kannst du für alles andere ohne schlechtes Gewissen das stärkste Modell nehmen.
Die Entscheidungshilfe liegt hier als PDF zum Herunterladen: zwölf Seiten mit beiden Fragen, der Liste was lokal läuft, der Faustregel, den Grafikkarten, den Modell-Familien und den Werkzeugen.
Kostenlos im Lab weiterlesen
Die restlichen Schritte Schritte, alle Prompts und die Dateien zu diesem Tutorial gibt es kostenlos für Mitglieder.
- Die komplette Schritt-für-Schritt-Anleitung
- 1 Dateien und Vorlagen
- Fragen stellen und mitreden im Stammtisch
Keine Zeit zum Nachbauen?
Ich setze die Lösung für dich um oder schule dich und dein Team. Im kostenlosen Erstgespräch klären wir, was passt.


