Data Privacy Architecture für KI-Systeme
7. Dezember 2025, 14 Min. Lesezeit
Ein 9-Milliarden-Modell läuft auf dem Notebook und reicht für Klassifikation, Extraktion und Routing. Wo lokale KI trägt, wo nicht, und wie Sie sie absichern.
6,6 Gigabyte. So groß ist der Download von Qwen3.5-9B in der Ollama-Bibliothek. Das ist weniger als mancher Mitschnitt eines Quartalsmeetings und passt in den Arbeitsspeicher eines gewöhnlichen Business-Notebooks. Laut Model Card erreicht dieses Modell auf GPQA Diamond 81,7 Punkte und liegt damit vor gpt-oss-120B mit 80,1, einem Modell mit mehr als der zehnfachen Parameterzahl. Das sind Herstellerangaben, und Benchmarks sind keine Produktionslast. Die Richtung stimmt trotzdem.
Ich höre in Architektur-Reviews noch oft den Satz "Dafür nehmen wir das große Modell, sicher ist sicher". Gemeint ist dann eine Aufgabe wie: eingehende E-Mails einer von zwölf Kategorien zuordnen. Dafür ein Frontier-Modell zu bezahlen, ist ungefähr so, als würde man für den Weg zum Bäcker einen Sattelzug mieten. Er kommt an, keine Frage.
Meine These für diesen Artikel: Bei eng umrissenen Aufgaben werden lokale Modelle die großen Foundation-Modelle Schritt für Schritt verdrängen. Bei offenen, mehrstufigen Aufgaben werden sie das auf absehbare Zeit nicht tun. Und wer lokal betreibt, übernimmt Sicherheitsarbeit, die vorher der Cloud-Anbieter gemacht hat. Die Kosten- und Hardwarerechnung für Cloud, On-Prem und Hybrid habe ich an anderer Stelle aufgeschrieben, hier geht es um die Frage, welche Aufgaben wohin gehören.
| Modell | Größen | Lizenz | Bemerkung |
|---|---|---|---|
| Qwen3.5 (kleine Serie) | 0,8B, 2B, 4B, 9B | 9B unter Apache 2.0 | 262.144 Token Kontext, Text, Bild und Video laut Model Card |
| Gemma 4 | E2B, E4B, 12B, 26B A4B, 31B | Apache 2.0 | Im April 2026 unter Apache 2.0 veröffentlicht, laut Google für lokale Ausführung ohne Cloud gedacht |
| Ministral 3 | 3B, 8B, 14B | Apache 2.0 | Europäischer Anbieter, vom Hersteller für "edge and local use cases" positioniert |
| gpt-oss-20b | 21 Mrd. Parameter, davon 3,6 Mrd. aktiv | Apache 2.0 | Läuft laut OpenAI in 16 GB Speicher, Function Calling eingebaut |
Dass diese Modelle so wenig Speicher brauchen, liegt an der Quantisierung. Die Gewichte werden mit weniger Bit gespeichert als im Training, typischerweise 4 bis 8 statt 16. Bei 4 Bit belegt eine Milliarde Parameter rechnerisch ein halbes Gigabyte. Was das an Qualität kostet, vergleicht eine Auswertung der llama.cpp-Formate vom Januar 2026 systematisch für 3 bis 8 Bit. Mein Rat: Messen Sie die quantisierte Variante an Ihrer eigenen Aufgabe.
Auf der Hardwareseite hat sich die Frage "Können wir das überhaupt betreiben?" weitgehend erledigt. Microsoft definiert Copilot+ PCs über eine NPU mit mehr als 40 TOPS, in der Geräteliste stehen Business-Modelle wie das Dell Latitude 7455 und das Lenovo ThinkPad T14s. Apple nennt für den M5 eine Speicherbandbreite von 153 GB/s und wirbt ausdrücklich damit, größere Modelle vollständig auf dem Gerät auszuführen. Eine Klasse darüber steht NVIDIAs DGX Spark mit 128 GB gemeinsamem Speicher, laut Hersteller für Inferenz mit Modellen bis 200 Milliarden Parameter. Als Laufzeitumgebung reichen auf dem Einzelplatz Ollama oder llama.cpp, für einen Teamserver mit vielen parallelen Anfragen ist vLLM die übliche Wahl.
Aufschlussreich finde ich, was die Plattformhersteller selbst tun. Apple liefert ein On-Device-Modell mit rund 3 Milliarden Parametern aus, quantisiert auf 2 Bit pro Gewicht, und beschreibt es so: stark bei Zusammenfassung, Entity-Extraktion, Textverständnis und kurzen Dialogen, aber "not designed to be a chatbot for general world knowledge". Google betreibt Gemini Nano im Android-Systemdienst AICore für Zusammenfassen, Korrekturlesen und Umformulieren, ohne Netzverbindung. Microsoft bietet mit Phi Silica ein lokales Modell für Copilot+ PCs an.
Drei Konzerne mit eigenen Frontier-Modellen geben die kleinen Aufgaben also an kleine Modelle. Ein Detail aus der Microsoft-Dokumentation sollte Sie allerdings hellhörig machen: Phi Silica wird laut derselben Seite ab November 2026 auf Endgeräten durch ein neues Modell namens Aion Instruct ersetzt, Entwickler sollen ihre LoRA-Adapter neu trainieren. Ein Modell, das mit dem Betriebssystem kommt, wechselt nach dem Zeitplan des Herstellers. Wer darauf eine Fachanwendung baut, braucht Regressionstests.
Die pointierteste Quelle dazu stammt von NVIDIA Research. Im Positionspapier Small Language Models are the Future of Agentic AI (Juni 2025, überarbeitet September 2025) argumentieren Belcak und Kollegen, kleine Modelle seien für die sich wiederholenden, eng geschnittenen Teilaufgaben in Agentensystemen "sufficiently powerful, inherently more suitable, and necessarily more economical". Ein kleines Modell ist dort eines, das auf ein übliches Endgerät passt, Stand 2025 also unter etwa 10 Milliarden Parameter. Den Betrieb eines 7-Milliarden-Modells beziffern die Autoren als 10 bis 30 Mal günstiger bei Latenz, Energie und Rechenaufwand als den eines Modells mit 70 bis 175 Milliarden Parametern. In drei Fallstudien schätzen sie, dass sich rund 60 Prozent der LLM-Aufrufe in MetaGPT, 40 Prozent in Open Operator und 70 Prozent in Cradle durch spezialisierte kleine Modelle ersetzen ließen. Es sind Schätzungen in einem Positionspapier, keine Messungen im Feld.
Belastbarer ist die Lage bei angepassten Modellen. In der Studie LoRA Land wurden 310 Modelle auf 31 Aufgaben feinjustiert. Die 4-Bit-Varianten lagen im Schnitt 34 Punkte über ihren Basismodellen und 10 Punkte über GPT-4. 25 dieser Adapter auf Basis von Mistral-7B liefen gemeinsam auf einer einzigen A100-GPU. Die Studie ist von 2024, der Vergleichsgegner GPT-4 ist längst abgelöst. Die kleinen Basismodelle von damals sind es aber auch.
Daraus ergibt sich für mich eine recht klare Liste von Aufgaben, bei denen ich 2026 zuerst ein lokales Modell prüfen würde: Klassifikation und Routing von Tickets und E-Mails, Extraktion von Feldern aus Rechnungen und Verträgen, Zusammenfassung einzelner Dokumente, Erkennen und Schwärzen personenbezogener Daten vor einem Cloud-Aufruf, Antworten aus einem eng begrenzten RAG-Bestand, einzelne Function Calls mit festem Schema. Gemeinsam ist ihnen, dass die Eingabe kurz ist, das Ausgabeformat feststeht und Sie die Qualität an ein paar hundert Beispielen messen können.
Die Gründe für lokal sind dann selten nur die Tokenkosten. Die Juristin im Einkauf kann einen Vertragsentwurf zusammenfassen lassen, ohne dass vorher ein Drittlandtransfer geprüft werden muss (die übrigen Pflichten bleiben, siehe DSGVO und LLM Compliance). Die Klassifikation läuft auch, wenn der Anbieter eine Störung hat oder das Werk in Tschechien gerade kein Netz. Und niemand kündigt Ihnen das Modell ab, auf das Sie Ihre Prompts monatelang abgestimmt haben.
Googles eigene Zahlen zeigen die Grenze ziemlich genau. In der Gemma-4-Model-Card erreicht das kleine E4B auf MMLU Pro 69,4 Prozent, das 31B-Modell 85,2. Beim agentischen Benchmark Tau2 sind es 42,2 gegenüber 76,9 Prozent, das kleinste Modell E2B kommt auf 24,5. Wissen skaliert also halbwegs gnädig nach unten, mehrstufiges Handeln mit Werkzeugen nicht.
Eine Arbeit zu kleinen Modellen auf Edge-Geräten kommt zum gleichen Bild: Die besten Modelle im Bereich von 1 bis 3 Milliarden Parametern erreichten im Berkeley Function Calling Leaderboard nach aufwendiger Optimierung 65,74 Prozent insgesamt und 55,62 Prozent bei mehrstufigen Dialogen. Für einen einzelnen Aufruf mit Plausibilitätsprüfung kann das genügen. In einem Agentenlauf multiplizieren sich die Fehler. Ein Rechenbeispiel: Bei 95 Prozent Trefferquote pro Schritt kommen nach 20 abhängigen Schritten noch etwa 36 Prozent der Läufe fehlerfrei durch.
Komplexe Analyse über lange Dokumente, Codeänderungen über mehrere Dateien, offene Recherche, lange Agentenläufe mit vielen Werkzeugen: Hier würde ich kein Modell unter 30 Milliarden Parametern ohne menschliche Kontrolle einsetzen, und in vielen Fällen auch kein lokales. Die NVIDIA-Autoren räumen selbst ein, dass große Modelle beim allgemeinen Sprachverständnis vorn bleiben.
Das Architekturmuster, das daraus folgt, funktioniert wie der First-Level-Support: Die meisten Anfragen löst die erste Stufe, der Rest wird weitergereicht. Die Arbeit RouteLLM hat gezeigt, dass ein gelernter Router zwischen einem schwächeren und einem stärkeren Modell die Kosten in manchen Fällen mehr als halbiert, ohne dass die Antwortqualität leidet.
In der Praxis braucht der Router drei Dinge. Erstens ein Eskalationskriterium, das sich prüfen lässt: Schema verletzt, Konfidenz unter Schwellwert, Eingabe länger als das Kontextbudget, Aufgabe nicht auf der Liste bekannter Typen. Zweitens eine Regel, was eskalieren darf. Im Deployment-Artikel routet der Proxy nach Datenklasse, hier kommt die Schwierigkeit als zweite Achse hinzu, und die Datenklasse gewinnt. Ein vertrauliches Dokument, an dem das kleine Modell scheitert, geht an ein größeres lokales Modell oder an einen Menschen, aber nie automatisch in die Cloud. Drittens eine Messung der Eskalationsquote. Steigt sie, hat sich die Eingabe verändert oder das Modell wurde getauscht.
Im Bitkom Cloud Report vom 17. Juni 2026 halten 85 Prozent der 603 befragten Unternehmen Deutschland für zu abhängig von US-Cloud-Anbietern. 42 Prozent beziehen KI-Dienste aus der Cloud, 69 Prozent planen das binnen fünf Jahren. Bitkom-Präsident Wintergerst sagt dazu: "Künstliche Intelligenz ist die Zukunftstechnologie schlechthin und braucht Rechenleistung, die häufig nur Cloud-Dienste anbieten."
Für Training und Frontier-Inferenz stimmt das. Für die Aufgaben aus der Liste oben stimmt es 2026 nicht mehr, und genau dort liegt ein großer Teil des Alltagsvolumens. Die EU-Kommission hat am 3. Juni 2026 den Vorschlag für einen Cloud and AI Development Act vorgelegt, der die Rechenzentrumskapazität in der EU binnen fünf bis sieben Jahren mindestens verdreifachen soll und Souveränitätsstufen für die öffentliche Beschaffung vorsieht. Das ist ein Vorschlag, Parlament und Rat verhandeln noch. Ich würde keine Architekturentscheidung darauf stützen. Ein Klassifikator auf dem eigenen Server ist heute verfügbar.
Jetzt zu dem Teil, der in den Begeisterungsvorträgen fehlt. "Lokal" heißt, dass Sie einen Inferenzserver betreiben, Binärdateien aus dem Internet laden und beides aktuell halten müssen.
Offene Instanzen. SentinelLABS und Censys haben über 293 Tage 175.108 öffentlich erreichbare Ollama-Hosts in 130 Ländern gezählt, 48 Prozent davon mit aktivierten Tool-Calling-Fähigkeiten. Ollama bindet laut eigener FAQ standardmäßig an 127.0.0.1, eine Authentifizierung erwähnt die FAQ nicht. Es genügt also eine einzige Umgebungsvariable, gesetzt vom Entwickler, der das Modell "nur kurz" vom zweiten Rechner aus erreichen wollte.
Lücken in der Laufzeitumgebung. Cyera hat im Mai 2026 mit Bleeding Llama (CVE-2026-7482, CVSS 9,1) eine Lücke in Ollama veröffentlicht, über die sich ohne Anmeldung Prozessspeicher auslesen ließ, darunter Prompts, Systemprompts und Umgebungsvariablen. Cyera spricht von rund 300.000 erreichbaren Servern. vLLM hatte im Februar 2026 mit CVE-2026-22778 eine Remote Code Execution mit CVSS 9,8, behoben in Version 0.14.1. Für llama.cpp wurde am 7. August 2026 CVE-2026-43631 mit CVSS 9,2 veröffentlicht. Inferenzserver gehören ins Patch-Management wie jeder Webserver. In vielen Umgebungen, die ich sehe, laufen sie dagegen als Experiment eines Teams, das niemand inventarisiert hat.
Herkunft der Gewichte. Das klassische PyTorch-Format basiert auf Pickle, und Hugging Face warnt selbst, dass beim Laden beliebiger Code ausgeführt werden kann. ReversingLabs fand im Februar 2025 zwei Modelle auf Hugging Face, die den Scanner der Plattform umgingen und beim Laden eine Reverse Shell öffneten. Laden Sie Gewichte als safetensors oder GGUF, ausschließlich aus den Konten der Hersteller, und halten Sie Version und Hash fest. Die OWASP Top 10 für LLMs stellen nüchtern fest: "Currently there are no strong provenance assurances in published models." Die Lizenz gehört in dieselbe Prüfung. Apache 2.0 ist unkompliziert, andere Modell-Lizenzen enthalten Nutzungsbeschränkungen, die Ihre Rechtsabteilung lesen sollte.
Prompt Injection. Sie verschwindet durch lokalen Betrieb nicht. Ein kleines Modell, das eine präparierte E-Mail zusammenfasst und danach ein Werkzeug aufruft, ist genauso angreifbar wie ein großes, eher mehr. Alles aus dem Artikel zu Prompt Injection gilt unverändert, vor allem die Begrenzung dessen, was das Modell auslösen darf.
| Anwendungsfall | Empfehlung | Begründung |
|---|---|---|
| E-Mail- und Ticket-Klassifikation | Lokal | Festes Schema, hohes Volumen, gut messbar |
| Feldextraktion aus Rechnungen, Verträgen | Lokal | Oft personenbezogen, Ausgabe validierbar |
| PII-Erkennung vor Cloud-Aufrufen | Lokal | Der Filter darf die Daten nicht selbst verschicken |
| Zusammenfassung einzelner Dokumente | Lokal | Auch im Betriebssystem schon so gelöst |
| Interner Wissensassistent (RAG) | Hybrid | Klein zuerst, Eskalation nach Datenklasse |
| Code-Assistenz | Hybrid | Vervollständigung lokal, größere Umbauten groß |
| Mehrstufige Agenten mit vielen Werkzeugen | Cloud oder großes Modell im eigenen Rechenzentrum | Fehler multiplizieren sich über die Schritte |
| Offene Recherche, komplexe Analyse | Cloud | Hier zählt die Qualitätsspitze |
Eine Grundsatzentscheidung "alles lokal" empfehle ich nicht. Sie verlieren damit die Aufgaben, bei denen große Modelle den Unterschied machen.
Nehmen Sie den Cloud-LLM-Anwendungsfall mit dem höchsten Aufrufvolumen, der im Kern eine Klassifikation oder Extraktion ist. Lassen Sie 200 echte, bereits geprüfte Beispiele durch ein lokales 9B-Modell auf einem Entwickler-Notebook laufen, ohne Netzfreigabe des Ports, und legen Sie die Ergebnisse neben die des bisherigen Modells. Das ist ein Nachmittag Arbeit. Danach wissen Sie für diesen einen Fall, ob die These bei Ihnen trägt, und haben nebenbei Ihren ersten Testdatensatz.
Für Vorträge, Interviews und fachlichen Austausch erreichen Sie mich direkt. Projekte und Beratung laufen über meinen Arbeitgeber ADVISORI, den Kontakt stelle ich gern her.