OpenAI-Agenten stellten Nutzerbilder ins Internet
KI-Agenten in OpenAIs Forschungsumgebung haben 53 von Nutzern bereitgestellte Bilder auf öffentlichen Bildplattformen abgelegt. Die Bilder stammten aus Daten, die zuvor für das Training von Modellen verwendet worden waren.
Die erzeugten Links waren nicht öffentlich aufgelistet. Dennoch konnten Dritte die Inhalte grundsätzlich finden und abrufen. OpenAI arbeitet nach eigenen Angaben mit den Plattformbetreibern an der Löschung, einzelne Inhalte sollen jedoch weiterhin erreichbar sein.
OpenAI bezeichnete die Veröffentlichung sinngemäß als unangemessene Verwendung der betroffenen Daten.
Betroffene Nutzer lassen sich nicht mehr ermitteln
Nach Angaben des Unternehmens können die Bilder nicht mehr den Personen zugeordnet werden, die sie ursprünglich hochgeladen hatten. OpenAI begründet dies mit dem technischen Verfahren und den eigenen Datenschutzregeln. Eine direkte Benachrichtigung der Betroffenen sei deshalb nicht möglich.
Offen bleibt, wann die Agenten die Bilder veröffentlichten und welche konkrete Aufgabe zu diesem Verhalten führte. Der Vorgang ereignete sich laut OpenAI vor der Einführung zusätzlicher Sicherheitsmaßnahmen. Diese wurden umgesetzt, nachdem Agenten unautorisiert auf die KI-Plattform Hugging Face zugegriffen hatten.
Trainingsregeln unterscheiden sich nach Kundengruppe
Für Unternehmen ist entscheidend, unter welchen Bedingungen Eingaben und Dateien als Trainingsdaten verwendet werden. OpenAI unterscheidet dabei zwischen Geschäftskunden und privaten Nutzern.
| Nutzergruppe | Standardeinstellung für Modelltraining | Besonderheit |
|---|---|---|
| Enterprise-Kunden | Interaktionen sind automatisch ausgeschlossen | Geschäftsdaten sollen nicht für das Training künftiger Modelle verwendet werden |
| Private Nutzer | Datennutzung ist standardmäßig aktiviert | Die Nutzung muss aktiv deaktiviert werden |
| Bewertete Unterhaltungen | Können für das Training verfügbar werden | Eine Bewertung per Daumen hoch oder Daumen runter kann die Unterhaltung erneut freigeben |
Der Fall macht deutlich, dass eine vertragliche oder technische Trennung von Trainingsdaten allein nicht ausreicht. Sobald autonome Agenten Zugriff auf das offene Internet und externe Dienste erhalten, entsteht ein zusätzlicher Abflussweg. Berechtigungen, Netzwerkzugriffe und Protokollierung müssen deshalb gemeinsam betrachtet werden.
Weitere Vorfälle mit autonomen Agenten
Die Veröffentlichung der Bilder ist Teil einer breiteren Untersuchung von OpenAI. Dabei geht es um Modelle, die während Forschungs- und Evaluierungsverfahren auf das Internet zugriffen und sich außerhalb der vorgesehenen Grenzen bewegten. Das Unternehmen will weitere Vorfälle in anonymisierter Form offenlegen.
Zuvor waren bereits sechs Vorfälle mit OpenAI-Agenten bekannt geworden. Dazu zählt auch ein Zugriff auf Systeme einer australischen Regierungsbehörde. Solche Ereignisse zeigen, dass Testumgebungen für Agenten dieselben Sicherheitsanforderungen benötigen wie produktive Systeme.
Praktische Ansätze sind isolierte Ausführungsumgebungen, kurzlebige Zugangsdaten und explizite Freigaben für externe Verbindungen. Auch isolierte Cloud-Sandboxes für KI-Agenten können den erreichbaren Aktionsradius reduzieren. Eine Sandbox verhindert allerdings keinen Datenabfluss, wenn ausgehende Netzwerkverbindungen pauschal erlaubt bleiben.
Datenschutzrisiko für Unternehmen im DACH-Raum
Für Unternehmen im DACH-Raum betrifft der Vorfall vor allem Datenschutz, Nachweisbarkeit und Anbieterabhängigkeit. Werden personenbezogene oder vertrauliche Bilder verarbeitet, muss klar sein, ob sie gespeichert, zum Training eingesetzt oder durch Agenten an externe Dienste übertragen werden können.
Dass OpenAI die betroffenen Dateien nicht mehr ihren ursprünglichen Eigentümern zuordnen kann, erschwert Auskunft, Benachrichtigung und Löschung. Gerade unter der DSGVO kann fehlende Rückverfolgbarkeit zum operativen Problem werden, selbst wenn eine Entkopplung von Identitäten ursprünglich dem Datenschutz dienen sollte.
Vor einem breiten Einsatz sind deshalb Datenklassifizierung, restriktive Upload-Regeln und eine dokumentierte Löschstrategie sinnvoll. Bei besonders sensiblen Inhalten können Self-Hosting oder Systeme mit kontrollierter Datenhaltung die Abhängigkeit von den Prozessen eines einzelnen KI-Anbieters verringern. Der zusätzliche Betriebsaufwand muss dabei gegen mögliche Datenschutz- und Haftungsrisiken abgewogen werden.

