„Unsere Daten dürfen nicht in die Cloud.“ Mit diesem Satz beginnt ein großer Teil der Gespräche über Automatisierung mit Sprachmodellen, und er ist selten eine Entscheidung. Er ist eine Sorge, die nach einer Entscheidung sucht. Ob ein Modell beim Anbieter läuft oder auf einem Server im eigenen Haus, lässt sich an vier Stellen festmachen, und an jeder davon ist die Antwort messbar. Für viele Unternehmen im Mittelstand fällt sie anders aus, als die Sorge vermuten lässt.
Lokale KI oder Cloud-Modell: worüber wir reden
Lokal heißt: ein offenes Modell wie Llama, Mistral oder Qwen läuft auf eigener Hardware, meist einem Server mit einer oder mehreren GPUs, betrieben von jemandem in Ihrem Haus oder bei einem Hoster unter Ihrer Kontrolle. Die Daten verlassen den Rechner nicht, die Modellwahl liegt bei Ihnen, der Betrieb ebenfalls.
Cloud heißt: ein Modell wird über die Schnittstelle eines Anbieters aufgerufen. Sie zahlen nach verarbeiteten Tokens, wählen die Region, in der die Verarbeitung stattfindet, und regeln den Umgang mit den Daten über einen Auftragsverarbeitungsvertrag. Die großen Anbieter bieten inzwischen Verarbeitung in der EU an und sichern vertraglich zu, dass Eingaben nicht zum Training verwendet werden.
Beides sind Werkzeuge. Welches passt, entscheiden vier Fragen an Ihr Unternehmen.
Frage 1: Dürfen die Daten das Haus verlassen?
Nicht „wollen wir das“, sondern „dürfen wir das“. Die Antwort steht in Ihren Verträgen mit Kunden, in branchenspezifischen Vorgaben, in Vereinbarungen mit dem Betriebsrat und in Ihrer eigenen Datenschutzerklärung. Wer Gesundheitsdaten, Mandantenakten oder Daten unter Geheimhaltungsvereinbarung verarbeitet, findet dort oft eine klare Grenze.
Lautet die Antwort nein, ist das Gespräch an dieser Stelle beendet: lokal, ohne Diskussion über Kosten oder Qualität. Lautet sie „ja, unter Bedingungen“, sind diese Bedingungen in der Cloud meistens erfüllbar: Verarbeitung in der EU, ein Auftragsverarbeitungsvertrag, kein Training mit Ihren Daten, und vor allem die Anonymisierung der heiklen Felder, bevor ein Text das Haus verlässt. Namen, Adressen, Kundennummern lassen sich im eigenen Backend durch Platzhalter ersetzen; das Modell ordnet den Vorgang trotzdem richtig ein. Dieser Schritt gehört zu jeder Pipeline, die ich baue, unabhängig davon, wo das Modell läuft.
Frage 2: Welche Qualität verlangt die Aufgabe?
Nicht jede Aufgabe braucht das stärkste verfügbare Modell. E-Mails nach Typ und Dringlichkeit einordnen, Rechnungsnummer und Betrag aus einem PDF ziehen, einen Text in ein Schema übertragen: Das leisten offene Modelle in der Größenklasse, die auf einer einzelnen GPU läuft, zuverlässig genug, sofern die Pipeline einen Prüfschritt für unsichere Fälle hat.
Anders sieht es aus, wenn das Modell lange Dokumente mit Nuancen lesen, mehrstufig schlussfolgern oder in seltenen Sprachen und Fachgebieten formulieren soll. Dort liegen die großen Cloud-Modelle nach öffentlichen Vergleichen weiterhin vorn, und der Abstand ist für den Nutzer spürbar. Ich stütze mich hier auf veröffentlichte Vergleiche und auf Erfahrungsberichte, nicht auf eigene Messungen mit lokalen Modellen; wer die Entscheidung trifft, sollte sie an seiner eigenen Aufgabe mit einem Testset von echten Fällen prüfen, bevor er Hardware bestellt.
Frage 3: Wie viel Volumen fällt an?
Die Cloud kostet pro verarbeitetem Token, also proportional zur Nutzung. Eigene Hardware kostet einmal beim Kauf oder monatlich bei der Miete, dazu Strom und die Zeit der Person, die sie betreibt. Das sind zwei verschiedene Kostenkurven: eine beginnt bei null und steigt mit dem Volumen, die andere beginnt hoch und bleibt flach.
Daraus folgt eine einfache Regel. Bei kleinem oder unregelmäßigem Volumen ist die Cloud günstiger, und zwar deutlich, weil die Hardware die meiste Zeit stillstehen würde. Bei hohem, gleichmäßigem Volumen kann die eigene Maschine günstiger werden. Wo genau der Punkt liegt, hängt vom Modell, von der Länge der Texte und vom Preis des Anbieters ab, und er verschiebt sich, weil die Preise auf beiden Seiten fallen. Deshalb rechne ich ihn im Projekt mit echten Zahlen aus und nicht auf einer Folie; jede Zahl, die ich hier nennen würde, wäre in einem halben Jahr falsch.
Frage 4: Wer betreibt die Hardware?
Diese Frage wird am häufigsten übersehen und entscheidet am häufigsten. Ein lokales Modell ist ein Server mit GPU, einem Inferenz-Dienst, Treibern, Updates, Monitoring und einem Backup-Plan. Modelle werden abgelöst, Treiber brechen, eine GPU fällt am Freitagabend aus. Jemand muss zuständig sein, und zwar nicht nebenbei.
Ein Unternehmen mit eigener IT, die ohnehin Server betreibt, kann diese Zuständigkeit übernehmen. Ein Unternehmen ohne IT-Abteilung kann es nicht, und ein externer Dienstleister, der die Maschine betreut, ist dann wieder ein Dritter mit Zugriff auf alle Daten, nur mit weniger Vertragsapparat als ein Cloud-Anbieter. Wer Frage 1 mit „nein“ beantwortet hat, muss diese Frage trotzdem lösen; wer sie mit „ja, unter Bedingungen“ beantwortet hat, hat hier den stärksten Grund, bei der Cloud zu bleiben.
Der Preis, auf beiden Seiten
Die Cloud hat ihren Preis, und er ist nicht nur der auf der Rechnung. Sie sind von einem Anbieter abhängig: von seinen Preisen, von seiner Entscheidung, ein Modell abzuschalten, von seiner Verfügbarkeit. Jeder Aufruf geht über das Netz und braucht Zeit, was bei interaktiven Anwendungen auffällt. Und jede Übertragung von Daten muss begründet und dokumentiert sein, auch wenn sie erlaubt ist. Meine eigenen Pipelines laufen auf Cloud-Modellen, und ich kenne diese Kosten aus dem Betrieb.
Die eigene Hardware hat ihren Preis genauso. Sie zahlen, bevor der erste Vorgang verarbeitet ist, und zwar für eine Maschine, die bei Fehlplanung zu klein oder zu groß ist. Sie binden eine Person an den Betrieb. Das Modell, das Sie heute installieren, ist in einem Jahr nicht mehr das beste seiner Klasse, und der Wechsel ist Arbeit. Und Sie tragen die Sicherheit der Maschine selbst, auf der nun alle Daten konzentriert liegen, die vorher auf viele Systeme verteilt waren. Ein schlecht gepflegter Server im Haus ist kein kleineres Risiko als ein gut gepflegter Dienst beim Anbieter, nur ein anderes.
Grenze
Es gibt Fälle, in denen ich trotz allem zur eigenen Hardware rate: wenn die Daten den Kontrollbereich nicht verlassen dürfen, das Volumen hoch und gleichmäßig ist und eine IT bereitsteht, die den Betrieb übernimmt. Treffen alle drei Bedingungen zu, ist lokal die richtige Wahl.
Dazwischen gibt es einen Weg, der oft übersehen wird: Ein kleines lokales Modell übernimmt die Vorsortierung und ersetzt heikle Angaben durch Platzhalter, und erst der bereinigte Text geht an ein Cloud-Modell für die anspruchsvollen Schritte. Das ist eine Architekturentscheidung, und sie verlangt beide Betriebsmodelle gleichzeitig. Sie lohnt sich dort, wo Frage 1 streng beantwortet wird und Frage 2 trotzdem nach dem großen Modell verlangt.
Schluss
Dürfen die Daten das Haus verlassen, welche Qualität braucht die Aufgabe, wie viel Volumen fällt an, wer betreibt die Hardware. Diese vier Fragen kläre ich im Erstgespräch, bevor über Modelle gesprochen wird, und die Antworten stehen danach schriftlich in der Aufwandsschätzung.