Vertraulichkeit und Vertrauen in den Anbieter
Datenschutz ist nicht die ganze Frage
Wenn Sie Ihren Namen aus einem Dokument entfernen, verschwindet nicht der Wert der darin enthaltenen Idee. Der Schutz personenbezogener Daten und die Vertraulichkeit des Geschäfts überschneiden sich, sind aber nicht dasselbe Versprechen.
Was der Navier–Stokes-Streit über das Vertrauen in einen Anbieter zeigt
Im September 2026 veröffentlichten Forschende eine KI-gestützte Lösung für ein seit Langem offenes Problem der Strömungsmechanik, die Navier–Stokes-Gleichungen. Kurz darauf entbrannte eine Debatte darüber, ob die vertraulichen Arbeiten der Forschenden die Modelle von OpenAI indirekt beeinflusst hatten, nachdem OpenAI unabhängig davon beansprucht hatte, dasselbe Problem mit dem eigenen Modell gelöst zu haben.
Als OpenAI nach dem Navier–Stokes-Ergebnis der Forschenden gefragt wurde, hieß es in der ersten Darstellung des Unternehmens, dass es nicht ausschließen könne, dass de-identifizierte Daten, die aus der Nutzung seiner Produkte abgeleitet wurden, zur Verbesserung seiner Modelle beigetragen haben. In einer Folgemitteilung auf der OpenAI-Seite wurde erklärt, dass ihre Prompts aus den vorangegangenen zwei Monaten das System nicht beeinflusst haben könnten, auch nicht über das Training.
Die Folgemitteilung ist eine Aussage über die eigene Untersuchung des Unternehmens. In den veröffentlichten Darstellungen stammten sowohl die Unsicherheit als auch die Beruhigung von OpenAI; dem Kunden wurden die zugrunde liegenden Beweise nicht zur unabhängigen Prüfung übergeben. Das belegt keinen Missbrauch. Es legt das zentrale Problem offen: Der Anbieter hält die Beweise in Händen, die nötig sind, um seine Darstellung zu überprüfen.
Und De-Identifizierung ist nicht dasselbe wie das Entfernen von Wert. Entfernen Sie den Namen aus einem Dokument, und es kann dennoch eine unveröffentlichte Methode, ein Preismodell, eine Strategie enthalten. Was ein Wettbewerber am meisten haben möchte, sind in der Regel nicht die personenbezogenen Datenpunkte, die die DSGVO schützt.
Was als „Kundendaten“ gilt, entscheidet der Vertrag
Verträge unterscheiden zwischen „Kundendaten“ und anderem Material, das das System erzeugt. An dieser Grenze beginnt Wert zu entweichen. Einbettungen, Zwischenzustände, Cache-Inhalte, Auswertungsprotokolle und abgeleitete Statistiken werden nicht immer als Kundendaten eingestuft, und eine Definition, die geschrieben wurde, als ein Produkt neu war, sieht selten eine KI-Ausgabe mit einem eigenen kommerziellen Leben voraus.
Der Anreiz ist nicht neutral. Trainingsdaten sind für ein KI-Unternehmen ein wertvolles Gut, und Nutzerinhalte können eine reichhaltige Quelle dafür sein. Ein Anbieter, der eine Darstellung Ihrer Eingaben als etwas anderes als Kundendaten behandeln kann, hat einen Weg gefunden, Ihr Material zu nutzen, ohne Ihnen die Rechte zu geben, die Sie zu haben glaubten. Diese Verträge werden von der Partei geschrieben, die den stärksten Grund hat, die Definition auszuweiten.
Es lohnt sich, direkt zu fragen, welche von diesen abgedeckt sind: rohe Prompts, fertige Ausgaben, Einbettungen, die die Bedeutung dessen kodieren, was Sie gesendet haben, die Inhalte eines Kontext- oder KV-Cache, der Ihr Material während einer Anfrage hält, und aggregierte Statistiken, die aus Ihrer Nutzung abgeleitet wurden. Lautet die Antwort „nur rohe Eingaben“, liegt die am besten wiederverwendbare Form Ihrer Daten womöglich bereits außerhalb des Versprechens.
Der Anbieter kann lesen, was Sie eingeben, wenn er sich dafür entscheidet
OpenAI hat nach eigenen Worten gezeigt, dass es Prompt-Inhalte liest und darauf reagiert. Sein Bedrohungsbericht vom Juni 2026 beschreibt Cluster von ChatGPT-Konten, die das Unternehmen als verdeckte Einflussoperationen einstufte und sperrte, und zitiert und fasst zusammen, wozu diese Nutzer das Modell zu generieren aufforderten. Mit anderen Worten: Der Anbieter prüfte die Prompt-Aktivität bestimmter Nutzer und ergriff Maßnahmen auf ihrer Grundlage. Der Bericht stellt diese Maßnahmen als Reaktionen auf verdeckte Einflussoperationen dar.
Dieses veröffentlichte Beispiel zeigt, dass die Aktivitäten von Nutzern überprüft werden und dass Maßnahmen gegen ihre Interessen ergriffen werden können. In diesem besonderen Fall wurde dieser Eingriff öffentlich gemacht. Nutzer haben keine unabhängige Möglichkeit zu wissen, ob und wann ihre eigenen Daten hinter den Kontrollen des Anbieters überprüft, gespeichert, verwendet oder zum Anlass von Maßnahmen werden.
Nichts davon muss böswillig sein, um von Bedeutung zu sein. Ihre Eingaben durchlaufen die Maschinen, Protokolle und Urteile anderer. Das Services Agreement legt in Abschnitt 4.2 Zusagen zur Datennutzung fest; es verschafft Ihnen keinen direkten Einblick darin, wie diese Zusagen umgesetzt werden.
Routing-Dienste bringen weitere Hände ins Spiel, durch die Ihre Daten hindurchmüssen
Aggregatoren, die vielen Modellanbietern vorgelagert sind, wie OpenRouter, machen die angreifbare Fläche größer. OpenRouter erklärt in seiner eigenen Dokumentation, dass es Prompts standardmäßig nicht speichert, und bietet eine Einstellung, um das Routing zu Anbietern zu vermeiden, die möglicherweise mit Ihren Daten trainieren. Diese Einstellung existiert, weil einige der Anbieter hinter einem Router tatsächlich mit dem trainieren, was sie empfangen.
Die Prüffrage bleibt auch bei Einstellungen für Zero-Retention bestehen: Welche Belege kann jede Partei dafür erbringen, dass die vereinbarte Richtlinie auf Ihre Anfrage angewendet wurde, einschließlich abgeleiteter Daten und Löschung? Die Dokumentation beschreibt das Versprechen; von sich aus verifiziert sie die Einhaltung nicht.
So kann eine einzige Anfrage mehrere Unternehmen durchlaufen, jedes mit eigenen Bedingungen für Speicherung und Training, und von Ihnen wird erwartet, dass Sie sie alle kennen und ihnen vertrauen. Ein Gateway bringt Bequemlichkeit und zugleich weitere Parteien ins Spiel: mehr Orte, an denen Ihre Inhalte existieren, mehr Richtlinien, denen Sie vertrauen müssen, mehr Fehler, die Sie nicht beobachten können.
Eine Unternehmensrichtlinie stoppt das Leck nicht
Viele Organisationen haben Richtlinien eingeführt: Legen Sie kein vertrauliches Material in einen KI-Dienst. Die Richtlinie ist notwendig, und für sich allein ist sie schwach. Ein Proxy oder Gateway kann so konfiguriert werden, dass es offensichtliche personenbezogene Daten abfängt, bevor sie die Organisation verlassen, und die Bußgelder der DSGVO geben einer Organisation einen Grund, es zu versuchen. Die Datenschutzrichtlinie für Kommunikation von OpenAI ist ein Beispiel für den Umfang und die Grenzen, die sich ein Anbieter selbst setzt. Doch ein Filter für personenbezogene Daten ist kein Filter für Geheimnisse.
Personenbezogene Daten folgen oft einem Muster; ein Geschäftsgeheimnis ist gerade deshalb wertvoll, weil es etwas Besonderes ist — eine Formel, eine Vertragsposition, ein unveröffentlichtes Design, ein Angebot. Ein Filter für personenbezogene Daten kann ein Geheimnis nicht von harmlosem Text unterscheiden; eine schriftliche Richtlinie allein kann seine Offenlegung nicht verhindern. Der Verlust, der am meisten wiegt, ist zugleich am schwersten zu verteidigen und am schwersten zu beziffern. Ein Verstoß gegen den Schutz personenbezogener Daten zieht ein Bußgeld nach sich; ein Wettbewerber, der Ihre Strategie stillschweigend erfährt, hat möglicherweise etwas mitgenommen, das in keinem Verstoßbericht auftaucht, und es gibt womöglich keinen praktischen Weg, zu beweisen, dass es geschah, oder es zurückzubekommen.
Bring-Your-Own-Key löst weniger, als es verspricht
Betrachten wir ein Hardware-Sicherheitsmodul (HSM). Ein HSM ist ein manipulationssicheres Gerät, das Ver- und Entschlüsselung durchführt, während der geschützte Schlüssel im Gerät verbleibt. Das ist ein starker Schutz für einen Schlüssel im Ruhezustand.
Die Grenze liegt darin, wo das Gerät steht. Das HSM befindet sich in der Umgebung des Anbieters, und um es zu nutzen, laufen Daten und Schlüssel durch die Prozesse des Anbieters. Ein symmetrischer Schlüssel auf dem Weg zu einem HSM kann von dem beobachtet werden, der die Maschinerie betreibt — der Anbieter betreibt genau die Systeme, die den Schlüssel während der Übertragung bewegen. Verschlüsselung in einem System, das Sie nicht betreiben, ist keine Verschlüsselung gegenüber dem Betreiber dieses Systems.
Zusagen zum Personal haben dieselbe Form. Eine Politik, nur EU-Bürger einzustellen, sagt etwas darüber aus, wer beschäftigt ist; sie sagt nichts darüber, was ein US-amerikanisches Mutterunternehmen liefern kann: einen Schlüssel, eine Wartungsschnittstelle, eine Designänderung — nichts davon erfordert einen EU-Beschäftigten. Das sind echte Abschwächungen. Sie verkleinern die Angriffsfläche. Sie beseitigen nicht das verbleibende Vertrauen — das Vertrauen, dass ein Anbieter in der Praxis davon absehen wird, etwas zu tun, wozu er in der Lage ist.
Was Sie tatsächlich verifizieren können, ist die Frage
Nichts davon bedeutet, dass Anbieter feindselig sind. Es bedeutet, dass Vertraulichkeit auf einer Mischung beruht aus dem, was Sie prüfen können, dem, was Sie als Zusicherung hinnehmen müssen, und dem, welche Abhilfe es gibt, wenn die Zusicherung versagt. Fragen Sie für jede Schicht — einen Modellanbieter, einen Aggregator, eine Schlüsselverwaltungsfunktion, eine Personalrichtlinie —, welche Belege Sie prüfen können, statt eine weitere Richtlinie als weitere Garantie zu zählen.
Genau diese Lücke schließt eine dedizierte Bereitstellung. Mit Hardware, die ausschließlich einem Kunden gewidmet ist, bestimmen Sie Datenflüsse, Protokollierung und Zugriffsregelungen, und Ihre Inhalte durchlaufen nicht die geteilten Dienste eines Betreibers. Das beseitigt weder Software- noch Sicherheits- noch menschliche Risiken. Es verschiebt die Grenze dessen, was Sie tatsächlich verifizieren können, dorthin, wo Ihre Inhalte tatsächlich liegen.
Quellen und weiterführende Lektüre
- Ursprüngliche OpenAI-Erklärung zu Navier–Stokes vom 8. September (archiviert)
- Aktuelle OpenAI-Darstellung, einschließlich der Aktualisierung vom 10. September
- OpenAI-Bedrohungsbericht Juni 2026 (PDF)
- OpenRouter: was gespeichert wird und was standardmäßig deaktiviert ist
- OpenRouter: Speicherungs- und Trainingsrichtlinien der Anbieter
- OpenAI-Datenschutzrichtlinie und Ausschlüsse vom Anwendungsbereich
- OpenAI Services Agreement, Abschnitt 4.2
- Amplify: KI-native Technik und IP-Verträge (Kommentar)