KI-Training im Unternehmen: Was erlaubt ist und wo Risiken liegen
Update Datenschutz Nr. 265
Der produktive Einsatz künstlicher Intelligenz gehört in vielen Unternehmen längst zum Alltag und damit rückt zunehmend die Frage in den Vordergrund, mit welchen Daten diese Systeme arbeiten dürfen. Häufig sollen eigene Kunden-, Beschäftigten- und sonstige Unternehmensdaten genutzt werden, um KI-Anwendungen für konkrete Aufgaben zu trainieren oder bestehende Systeme daran anzupassen. Wer diesen Schritt geht, bewegt sich in einem regulierten Umfeld, dessen Anforderungen sich nicht auf einen einzelnen Rechtsakt beschränken. Im Vordergrund steht die Datenschutz-Grundverordnung (DSGVO), die für nahezu jede Phase eines KI-Vorhabens Vorgaben bereithält, flankiert von urheberrechtlichen Grenzen dort, wo fremde Inhalte einbezogen werden. Hinzu treten aktuelle Entwicklungen auf Unionsebene. Während die KI-Verordnung zuletzt durch den KI-Omnibus (Verordnung (EU) 2026/1744) angepasst wurde, stehen die datenschutzrechtlichen Änderungen des sogenannten Datenomnibus, insbesondere eine ausdrückliche Rechtsgrundlage für das KI-Training, weiterhin im Gesetzgebungsverfahren und sind inhaltlich noch nicht belastbar. Der nachfolgende Beitrag ordnet die maßgeblichen Problemfelder entlang der geltenden Rechtslage ein und zeigt auf, worauf Unternehmen bei der Nutzung eigener und fremder Daten für KI-Zwecke bereits heute zu achten haben.
I. KI-Training als datenschutzrechtlicher Vorgang
Wollen Unternehmen ihre Datenbestände für das Training von KI nutzen, kann dies auf zwei Wegen geschehen. Zum einen können sie selbst ein Modell trainieren oder ein vorhandenes System mit eigenen Daten anpassen, etwa im Wege des Fine-Tunings. Zum anderen können sie ihre Daten einem externen Anbieter überlassen, dessen System auf dieser Grundlage weiterentwickelt wird. In beiden Fällen stellt sich dieselbe grundlegende Frage, nämlich ob und unter welchen Voraussetzungen die betroffenen Daten überhaupt zu diesem Zweck verwendet werden dürfen.
Denn sobald ein KI-System mit Daten arbeitet, die sich auf identifizierte oder identifizierbare natürliche Personen beziehen, findet die DSGVO Anwendung (Art. 2 Abs. 1, Art. 4 Nr. 1 DSGVO). Das gilt unabhängig davon, ob die Daten zur Erstellung eines Trainingsdatensatzes erhoben, zum eigentlichen Training verwendet oder erst in den Ausgaben des Systems verarbeitet werden. Der Einsatz von KI bildet dabei selten einen einheitlichen Vorgang, sondern gliedert sich in mehrere Phasen, die jeweils gesondert zu betrachten sind: die Erhebung der Daten, ihre Verwendung zum Training oder zur Anpassung eines Systems, den laufenden Betrieb und schließlich die Erzeugung von Ergebnissen. Für jede dieser Phasen können sich eigene Zwecke, Betroffenengruppen und damit auch eigene Anforderungen ergeben.
Von grundlegender Bedeutung ist zunächst die Klärung der Rolle, in der das Unternehmen handelt. Wer über Zwecke und Mittel der Verarbeitung entscheidet, ist Verantwortlicher im Sinne des Art. 4 Nr. 7 DSGVO und trägt die datenschutzrechtliche Hauptlast. Trainiert das Unternehmen selbst, ist es für diese Verarbeitung ohne Weiteres verantwortlich. Überlässt es die Daten hingegen einem Anbieter, hängt die Einordnung davon ab, in wessen Interesse und zu wessen Zwecken das Training erfolgt. Verarbeitet der Anbieter die Daten allein weisungsgebunden für das Unternehmen, ist er Auftragsverarbeiter, was eine Vereinbarung nach Art. 28 DSGVO erfordert. Nutzt er die überlassenen Daten dagegen zur Verbesserung seiner eigenen Modelle und damit zu eigenen Zwecken, kommt eine gemeinsame Verantwortlichkeit nach Art. 26 DSGVO oder eine eigenständige Verantwortlichkeit des Anbieters in Betracht.
II. Anforderungen der DSGVO
1. Rechtsgrundlage der Verarbeitung
Jede Verarbeitung personenbezogener Daten steht unter dem Erlaubnisvorbehalt des Art. 6 Abs. 1 DSGVO. Für das Training von KI mit eigenen oder überlassenen Datenbeständen kommen dabei vor allem die Einwilligung (Art. 6 Abs. 1 lit. a DSGVO) und das berechtigte Interesse (Art. 6 Abs. 1 lit. f DSGVO) in Betracht.
Die Einwilligung erscheint zunächst als der rechtssicherste Weg, erweist sich im Trainingskontext jedoch als operativ instabil. Da sie nach Art. 7 Abs. 3 DSGVO jederzeit widerrufen werden kann, entstehen erhebliche Schwierigkeiten, weil sich die Wirkung bereits eingeflossener Daten auf ein fertig trainiertes Modell nachträglich kaum beseitigen lässt. Als tragende Grundlage eines Trainingsvorhabens eignet sie sich daher nur in eng umgrenzten Konstellationen. Der praktische Regelfall ist somit das berechtigte Interesse nach Art. 6 Abs. 1 lit. f DSGVO. Dessen Heranziehung setzt eine dreistufige Prüfung voraus, nämlich die Benennung eines berechtigten Interesses, die Feststellung der Erforderlichkeit sowie eine Abwägung mit den Interessen und Grundrechten der Betroffenen. Dass Entwicklung und Training von KI ein berechtigtes wirtschaftliches Interesse begründen können, hat das OLG Köln im Verfahren des einstweiligen Rechtsschutzes bestätigt (Urteil vom 23. Mai 2025, Az. 15 UKl 2/25), allerdings nur auf Grundlage einer summarischen Prüfung. Maßgeblich bleibt gleichwohl die Abwägung im Einzelfall, die umso strenger ausfällt, je intensiver die Verarbeitung in die Rechte der Betroffenen eingreift. Da der Verantwortliche die Rechtmäßigkeit nachzuweisen hat (Art. 5 Abs. 2 DSGVO), ist eine sorgfältige Dokumentation der Prüfungsschritte anzuraten.
Ein eigenständiges Problem stellt sich, wenn für das Training Daten herangezogen werden sollen, die ursprünglich zu einem anderen Zweck erhoben wurden, etwa Kundendaten aus der Vertragsabwicklung. Insoweit ist der Grundsatz der Zweckbindung (Art. 5 Abs. 1 lit. b DSGVO) zu beachten, der eine Weiterverwendung nur bei Vereinbarkeit beider Zwecke gestattet. Die hierfür nach Art. 6 Abs. 4 DSGVO gebotene Kompatibilitätsprüfung gelingt umso schwerer, je weiter sich der Trainingszweck vom Erhebungszweck entfernt, sodass die Nutzung solcher Daten für ein davon losgelöstes KI-Modell regelmäßig einer gesonderten Rechtfertigung bedarf. Für die künftige Rechtslage ist auf den geplanten Art. 88c DSGVO-E hinzuweisen, der das berechtigte Interesse ausdrücklich auf Entwicklung und Betrieb von KI erstrecken soll (wir berichteten in Datenschutzupdate Nr. 223).
2. Besonderheiten bei sensiblen und Beschäftigtendaten
Eine gesteigerte Schwierigkeit ergibt sich, sobald besondere Kategorien personenbezogener Daten im Sinne des Art. 9 Abs. 1 DSGVO betroffen sind, etwa Angaben zu Gesundheit, ethnischer Herkunft oder politischer Überzeugung. Für sie gilt ein grundsätzliches Verarbeitungsverbot, das nur unter den engen Voraussetzungen des Art. 9 Abs. 2 DSGVO durchbrochen werden kann. Ein berechtigtes Interesse genügt hierfür gerade nicht, erforderlich ist vielmehr ein eigener Erlaubnistatbestand. Dieses Problem stellt sich beim KI-Training in besonderem Maße, weil sich in den großen zugrunde liegenden Datenmengen nahezu zwangsläufig auch sensible Daten befinden, zumal solche Informationen bereits mittelbar aus unverfänglichen Angaben abgeleitet werden können. Schon die Möglichkeit einer solchen Ableitung kann das Verbot auslösen, unabhängig von einer entsprechenden Absicht des Verantwortlichen. Für die nicht zielgerichtete Verarbeitung sensibler Daten beim KI-Training ist die Reichweite des Verbots allerdings umstritten. Das OLG Köln hat insoweit eine tätigkeitsbezogene Einschränkung angenommen, während das OLG Schleswig (Urteil vom 12. August 2025, Az. 6 UKl 3/25) einen Verstoß gegen Art. 9 Abs. 1 DSGVO für wahrscheinlich gehalten hat, sodass die Frage bislang ungeklärt ist.
Diesem Risiko lässt sich durch datenmindernde Gestaltung begegnen. Anonymisierung, Pseudonymisierung und der Einsatz synthetischer Daten verringern die Eingriffsintensität erheblich. Allerdings bleiben pseudonymisierte Daten personenbezogen, solange eine Zuordnung mit Zusatzwissen möglich ist (Art. 4 Nr. 5 DSGVO), und auch die Erzeugung synthetischer oder anonymisierter Daten kann ihrerseits eine Verarbeitung darstellen. Zudem trägt der Verantwortliche die Darlegungslast dafür, dass ein trainiertes Modell tatsächlich anonym ist. Für die künftige Rechtslage sieht der Datenomnibus mit Art. 9 Abs. 5 DSGVO-E eine gesonderte Regelung für zufällig erfasste sensible Daten vor, die jedoch ebenfalls noch nicht in Kraft und in ihrer derzeitigen Fassung nicht frei von Kritik ist.
Werden Beschäftigtendaten für das Training genutzt, ist die Verarbeitung im Ergebnis unmittelbar an Art. 6 und Art. 9 DSGVO zu messen. Hinzu tritt die Mitbestimmung des Betriebsrats nach § 87 Abs. 1 Nr. 6 BetrVG, sobald das System zur Überwachung von Verhalten oder Leistung geeignet ist, weshalb dieser frühzeitig einzubinden ist.
3. Betroffenenrechte am trainierten Modell
Auch beim Einsatz von KI gelten die Rechte der betroffenen Personen uneingeschränkt fort, insbesondere die Rechte auf Auskunft (Art. 15 DSGVO), Berichtigung (Art. 16 DSGVO), Löschung (Art. 17 DSGVO) und Widerspruch (Art. 21 DSGVO). Ihre Durchsetzung bereitet am trainierten Modell allerdings besondere Schwierigkeiten, weil einzelne personenbezogene Daten dort nicht als abgrenzbare Datensätze gespeichert, sondern in den Modellparametern aufgegangen sind. Es stellt sich daher die Frage, ob die Löschung einzelner Datenpunkte aus der Datenbasis genügt oder ob das Modell neu trainiert werden muss, zumal ein vollständiges „Unlearning“ bereits eingeflossener Daten nach derzeitigem Stand technisch kaum möglich ist.
Verschärft wird dies durch das Phänomen der Memorisierung, bei dem ein Modell Trainingsdaten in seinen Ausgaben ganz oder teilweise reproduzieren kann. Der bloße Einsatz von Ausgabefiltern, der eine solche Wiedergabe unterbindet, genügt den Anforderungen der Betroffenenrechte nicht, da das zugrunde liegende Datum im Modell fortbesteht und weiterhin ein Risiko begründet. Von seinen Pflichten ist der Verantwortliche damit nicht entbunden. Verlangt ist vielmehr ein nachvollziehbares Konzept, das darlegt, wie mit entsprechenden Begehren umgegangen wird und in welchen Intervallen Modelle überprüft und erforderlichenfalls neu trainiert werden. Für die Praxis empfiehlt es sich, diese Prozesse bereits vor Freigabe eines KI-Systems festzulegen, statt sie erst im Beschwerdefall zu improvisieren.
III. Urheberrechtliche Grenzen des Trainings mit fremden Daten
Werden für das Training nicht nur eigene Bestände, sondern auch fremde Inhalte herangezogen, etwa aus dem Internet abgerufene Texte, Bilder oder sonstige Werke, tritt neben den Datenschutz ein eigenständiger urheberrechtlicher Schutzstrang. Maßgeblich ist insoweit die Schranke des § 44b UrhG, die Vervielfältigungen zum Zweck des Text und Data Mining (TDM) gestattet und damit auch das Training von KI grundsätzlich erfasst. Die Nutzung ist jedoch ausgeschlossen, soweit der Rechteinhaber einen Nutzungsvorbehalt erklärt hat, der bei online zugänglichen Werken in maschinenlesbarer Form vorliegen muss (§ 44b Abs. 3 UrhG).
Die Reichweite dieser Schranke im KI-Kontext ist Gegenstand einer noch nicht gefestigten Rechtsprechung. Das LG München I hat mit Urteil vom 11. November 2025 (Az. 42 O 14139/24 – GEMA/OpenAI) angenommen, dass bereits die im Modell angelegte Reproduzierbarkeit memorisierter Inhalte eine Vervielfältigung nach § 16 UrhG darstellen kann und eine solche nicht mehr von § 44b UrhG gedeckt sei, weil die Schranke nur vorbereitende Vervielfältigungen zur Zusammenstellung des Trainingskorpus erfasse. Die Entscheidung ist nicht rechtskräftig und wurde teils erheblich kritisiert, unter anderem, weil sie die technischen Besonderheiten generativer Modelle nur unzureichend erfasse und eine Vorlage an den EuGH unterblieben ist. Für Unternehmen bedeutet dies, dass die urheberrechtliche Zulässigkeit des Trainings mit fremden Inhalten derzeit mit nicht unerheblicher Rechtsunsicherheit behaftet ist und die Beachtung erklärter Nutzungsvorbehalte besondere Sorgfalt verlangt.
IV. Checkliste zum KI-Training für Unternehmen
- Rollen und Anbietervertrag klären: Zunächst ist zu bestimmen, ob das Unternehmen als Verantwortlicher, Auftragsverarbeiter oder gemeinsam Verantwortlicher handelt, da sich hieran die jeweiligen Pflichten entscheiden. Bei Einsatz eines externen Systems ist eine Vereinbarung nach Art. 28 DSGVO zu schließen und vertraglich abzusichern, dass der Anbieter überlassene Daten nicht für eigene Zwecke, insbesondere nicht zur Verbesserung seiner eigenen Modelle, verwendet.
- Rechtsgrundlage bestimmen und dokumentieren: Für die Verarbeitung ist eine tragfähige Grundlage festzulegen, regelmäßig das berechtigte Interesse nach Art. 6 Abs. 1 lit. f DSGVO, dessen dreistufige Prüfung nachvollziehbar zu dokumentieren ist. Sollen bereits vorhandene Bestände genutzt werden, ist zusätzlich die Vereinbarkeit mit dem ursprünglichen Erhebungszweck nach Art. 6 Abs. 4 DSGVO zu prüfen.
- Sensible und Beschäftigtendaten gesondert behandeln: Bei besonderen Datenkategorien genügt das berechtigte Interesse nicht. Erforderlich ist ein eigener Erlaubnistatbestand nach Art. 9 Abs. 2 DSGVO sowie die Ergreifung von Maßnahmen, um sensible Daten im Datensatz möglichst zu vermeiden. Betrifft das Vorhaben Beschäftigtendaten, ist unmittelbar auf Art. 6 und Art. 9 DSGVO abzustellen und die Mitbestimmung des Betriebsrats nach § 87 Abs. 1 Nr. 6 BetrVG zu beachten, weshalb dieser frühzeitig einzubinden ist.
- Datenminimierung nutzen und Betroffenenrechte sicherstellen: Anonymisierung, Pseudonymisierung und synthetische Daten sollten eingesetzt werden, um die Eingriffsintensität zu senken, wobei ihre Grenzen zu berücksichtigen sind. Zugleich ist ein nachvollziehbares Konzept vorzuhalten, wie Auskunfts-, Berichtigungs-, Löschungs- und Widerspruchsbegehren am trainierten Modell begegnet wird, da Ausgabefilter allein nicht genügen.
- Fremde Inhalte und weitere Schutzrechte prüfen: Werden fremde oder aus dem Internet stammende Inhalte einbezogen, sind die Schranke des § 44b UrhG und etwaige maschinenlesbare Nutzungsvorbehalte zu beachten. Vertrauliche Informationen, Geschäftsgeheimnisse und Berufsgeheimnisse (§ 203 StGB) unterliegen eigenständigen, neben die DSGVO tretenden Bindungen und sind gesondert vertraglich abzusichern.
- Pflichten der KI-VO berücksichtigen: Unabhängig von der datenschutzrechtlichen Bewertung treffen den Betreiber eigene Pflichten aus der KI-Verordnung, insbesondere die Sicherstellung ausreichender KI-Kompetenz (Art. 4 KI-VO) sowie Transparenz- und Kennzeichnungspflichten (Art. 50 KI-VO).
V. Fazit und Ausblick
Die Nutzung eigener und fremder Daten für das Training von KI ist rechtlich anspruchsvoll, aber beherrschbar. Bereits das geltende Recht hält ein belastbares Prüfprogramm bereit, dessen Schwerpunkt in der DSGVO liegt und das durch urheberrechtliche Grenzen sowie die Betreiberpflichten der KI-Verordnung ergänzt wird. Wer die Rechtsgrundlage sorgfältig bestimmt, sensible Daten und Betroffenenrechte angemessen berücksichtigt und die Zusammenarbeit mit Anbietern vertraglich absichert, kann Trainingsvorhaben schon heute rechtssicher gestalten.
Der geplante Datenomnibus wird einzelne dieser Fragen künftig ausdrücklich regeln, insbesondere durch eine eigene Rechtsgrundlage für das KI-Training (Art. 88c DSGVO-E) und eine Sonderregelung für sensible Daten (Art. 9 Abs. 5 DSGVO-E). Da sich das Vorhaben noch im Gesetzgebungsverfahren befindet und inhaltlich nicht abschließend feststeht, bleibt seine praktische Bedeutung abzuwarten.
Dieser Beitrag wurde in Zusammenarbeit mit unserer stud. Mitarbeiterin Emily Bernklau erstellt.