Tiefe
Gleiches Kapitel, drei Tiefen. Die Wahl gilt überall und bleibt gespeichert.

GrundlagenBeurteilen und EinordnenKapitel 08von 8 im Pfad

Wo die Daten liegen und wie lange

Tiefe 1: Überblick · Lesezeit 8 Min. · Stand

Wer ein Sprachmodell über eine Schnittstelle nutzt, gibt Text aus der Hand. Ob der Anbieter damit trainieren darf und wer das Modell betreibt, klärt Kapitel 01. Dieses Kapitel fragt danach, was mit dem Text geschieht, solange er beim Anbieter liegt: an welchem Ort er gespeichert wird, an welchem er verarbeitet wird, wie lange er bleibt und mit wem darüber ein Vertrag besteht. Jede der großen Dokumentationen führt diese Angaben getrennt, und wer sie zusammenzieht, liest eine Zusage heraus, die dort nicht steht.

Speichern und Rechnen sind zwei Orte

Google schreibt die Trennung in zwei aufeinanderfolgende Sätze. Der erste betrifft das, was liegen bleibt:

Data stored at rest in the customer selected location remains at rest in that location (externe Seite, docs.cloud.google.com)

Der zweite betrifft die Verarbeitung, und zwar dann, wenn die Anfrage an einen weltweiten Endpunkt geht:

Requests submitted to a global endpoint may be processed in any Google Cloud location around the world, and therefore don’t provide any data residency guarantees. (externe Seite, docs.cloud.google.com)

Ein Projekt mit Speicherort Frankfurt kann also Anfragen haben, die in einem ganz anderen Erdteil gerechnet werden. Beides ist eine eigene Einstellung.

Anthropic führt für die eigene Schnittstelle ebenfalls zwei Einstellungen, eine für das Rechnen und eine für das Speichern. Voreingestellt ist beim Rechnen:

Inference may run in any available geography for optimal performance and availability. (externe Seite, platform.claude.com)

Die einzige Alternative dazu sind die USA, beim Speicherort ebenfalls. Eine europäische Wahl bietet Anthropic direkt bei keiner der beiden Einstellungen an. Über einen der großen Betreiber sieht das anders aus, das steht in Kapitel 01.

Die Region gilt für den Inhalt

Wer eine Region wählt, bindet damit den Inhalt der Anfragen, also Eingaben und Ausgaben. Was drumherum anfällt, gehört nicht dazu. OpenAI schreibt das ausdrücklich:

Data residency does not apply to system data, which may be processed and stored outside the selected region. (externe Seite, developers.openai.com)

Zu diesen Systemdaten zählt dieselbe Seite Kontodaten, Metadaten und Nutzungsdaten, darunter Abrechnung und Supportanfragen. Sie zeigen, wer wann wie viel mit welchem Modell gearbeitet hat, und sie liegen dort, wo der Anbieter sie führt.

Dazu kommt ein zweiter Rand. Anthropic nennt für interne Zwecke eigene Orte:

We may also process data for internal processes (such as safety-related review, product support, or incident response) in countries where we or our affiliates operate. (externe Seite, privacy.claude.com)

Eine Sicherheitsprüfung, eine Supportanfrage oder ein Vorfall kann den Text also an einen Ort bringen, den keine Einstellung festlegt.

Der Speicher, der ohne Training entsteht

Die bekannteste Zusage lautet, dass mit den Daten nicht trainiert wird. Sie sagt nichts darüber, ob die Daten gespeichert werden. Viele Anbieter halten Eingaben eine Zeit lang vor, um Missbrauch zu erkennen, und diese Frist steht neben der Trainingsfrage. OpenAI beziffert sie für die Schnittstelle:

By default, abuse monitoring logs are generated for all API feature usage and retained for up to 30 days, unless longer retention is required by law, or is reasonably necessary to protect our services or any third party from harm. (externe Seite, developers.openai.com)

Der Satz hat zwei Teile, und der zweite ist der wichtigere: Die 30 Tage sind eine Obergrenze für den Regelfall. Bei Anthropic steht die Ausnahme als eigene Zahl da, und sie gilt ausdrücklich auch für Kunden, die einen Betrieb ohne Speicherung vereinbart haben:

if a chat or session is flagged, Anthropic may retain inputs and outputs for up to 2 years (externe Seite, platform.claude.com)

Wer also „keine Speicherung“ vereinbart, vereinbart sie für den Normalfall. Ein Text, den ein automatischer Prüfer für einen Verstoß hält, bleibt länger. Eine Voreinstellung ohne diesen Speicher gibt es trotzdem: Amazon schreibt für seinen Modelldienst

This means that by default, Amazon Bedrock does not store model inputs or outputs. (externe Seite, docs.aws.amazon.com)

und nennt auf derselben Seite die Modelle, für die es davon abweicht. Die Übersicht über sechs Anbieter steht in Ebene 2.

Der Vertragspartner hängt am Weg

Datenschutzrechtlich ist, wer ein Modell im eigenen Unternehmen einsetzt, der Verantwortliche. Der Anbieter verarbeitet in seinem Auftrag und ist Auftragsverarbeiter. Welcher Anbieter das ist, hängt am Zugangsweg. Anthropic nennt für die eigene Schnittstelle sich selbst,

where Anthropic is the data processor (externe Seite, platform.claude.com)

und für die beiden großen Betreiber den jeweiligen Betreiber:

On Amazon Bedrock and Google Cloud’s Agent Platform, the cloud provider is the data processor (externe Seite, platform.claude.com)

Dasselbe Modell kann also unter drei verschiedenen Verträgen laufen, mit drei verschiedenen Speicherfristen und drei verschiedenen Regionen. Welche davon gilt, steht im Vertrag des Weges, den eine Anfrage tatsächlich nimmt. Das Rechtliche dahinter, bis zur Frage, wann eine Angabe überhaupt personenbezogen ist, steht in Ebene 3.

Quellen

29 Einträgealle erreichbar

Erreichbarkeit automatisch geprüft

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.