Text- und Data-Mining
§ 44b UrhG: Text- und Data-Mining und der maschinenlesbare Nutzungsvorbehalt
Das Gesetz erlaubt Vervielfältigungen für das Text- und Data-Mining, solange der Rechtsinhaber sich diese Nutzung nicht vorbehalten hat. Bei Inhalten, die online zugänglich sind, muss der Vorbehalt maschinenlesbar erklärt sein. Diese Seite gibt den Wortlaut der Vorschriften wieder, zeigt, in welchen Dateien und Signalen ein solcher Vorbehalt in der Praxis steht, und erklärt, warum später vor allem eines belegt werden muss: was dort an einem bestimmten Tag stand.
Der Wortlaut
In Deutschland steht die Regel in § 44b des Urheberrechtsgesetzes. Absatz 1 bestimmt, was Text- und Data-Mining ist, Absatz 2 erlaubt die Vervielfältigungen, Absatz 3 knüpft sie an den Vorbehalt. Die Vorschrift setzt Art. 4 der DSM-Richtlinie um, deren Absatz 3 lautet:
„Die Ausnahmen und Beschränkungen nach Absatz 1 finden Anwendung, sofern die jeweiligen Rechteinhaber die in Absatz 1 genannten Werke und sonstigen Schutzgegenstände nicht ausdrücklich in angemessener Weise, etwa mit maschinenlesbaren Mitteln im Fall von online veröffentlichten Inhalten, mit einem Nutzungsvorbehalt versehen haben.“
Richtlinie (EU) 2019/790, Art. 4 Abs. 3. Quelle: EUR-Lex, CELEX 32019L0790.
Der Wortlaut von § 44b UrhG, der Text- und Data-Mining und Vorbehalt regelt:
„(1) Text und Data Mining ist die automatisierte Analyse von einzelnen oder mehreren digitalen oder digitalisierten Werken, um daraus Informationen insbesondere über Muster, Trends und Korrelationen zu gewinnen.
(2) Zulässig sind Vervielfältigungen von rechtmäßig zugänglichen Werken für das Text und Data Mining. Die Vervielfältigungen sind zu löschen, wenn sie für das Text und Data Mining nicht mehr erforderlich sind.
(3) Nutzungen nach Absatz 2 Satz 1 sind nur zulässig, wenn der Rechtsinhaber sich diese nicht vorbehalten hat. Ein Nutzungsvorbehalt bei online zugänglichen Werken ist nur dann wirksam, wenn er in maschinenlesbarer Form erfolgt.“
§ 44b UrhG. Quelle: gesetze-im-internet.de, Bundesministerium der Justiz.
Auch die KI-Verordnung nimmt auf diesen Vorbehalt Bezug. Nach Art. 53 Abs. 1 Buchst. c müssen Anbieter von KI-Modellen mit allgemeinem Verwendungszweck
„eine Strategie zur Einhaltung des Urheberrechts der Union und damit zusammenhängender Rechte und insbesondere zur Ermittlung und Einhaltung eines gemäß Artikel 4 Absatz 3 der Richtlinie (EU) 2019/790 geltend gemachten Rechtsvorbehalts, auch durch modernste Technologien, auf den Weg“ bringen.
Verordnung (EU) 2024/1689, Art. 53 Abs. 1 Buchst. c. Quelle: EUR-Lex, CELEX 32024R1689.
Wo ein maschinenlesbarer Vorbehalt in der Praxis steht
Keiner dieser Texte nennt ein Dateiformat. In der Praxis stehen Vorbehalte, die sich an Maschinen richten, an einer Handvoll Stellen. Allen gemeinsam ist, dass eine Maschine sie liest, ohne dass ein Mensch dazwischensteht:
- /robots.txt: die älteste Anweisungsdatei im Web. Sie spricht Crawler mit dem Namen an, unter dem sie sich melden, und legt fest, welche Pfade sie abrufen dürfen.
- /.well-known/tdmrep.json: das TDM Reservation Protocol, in einer W3C Community Group eigens dafür entworfen, einen Vorbehalt gegen Text- und Data-Mining zu erklären.
- HTTP-Header und Meta-Tags der Startseite: dasselbe Protokoll lässt sich auch in einem Antwort-Header oder im HTML-Kopf erklären, ganz ohne eigene Datei.
- /ai.txt und /llms.txt: neuere Konventionen, die sich an KI-Systeme richten, bisher nicht standardisiert.
Welche dieser Formen im Einzelfall genügt, ist eine Rechtsfrage, und diese Seite beantwortet sie nicht. Beantworten lässt sich eine Tatsachenfrage: was eine bestimmte Datei oder ein bestimmter Header an einem bestimmten Tag gesagt hat.
Warum es auf den Tag ankommt
Ein Vorbehalt ist der Zustand einer Datei zu einem Zeitpunkt. Der Server führt darüber kein Protokoll: Wird die robots.txt geändert, ist die alte Fassung weg, und nichts auf dem Server verrät, wann sie sich geändert hat oder was vorher dastand. Die Frage nach einem Vorbehalt stellt sich aber meist Monate nach dem Tag, um den es geht. Dann zeigt ein heute gemachter Screenshot eben heute, und ein Serverprotokoll ist die Aussage einer Partei.
Gebraucht wird dann eine Aufzeichnung vom Tag selbst, gemacht von jemandem, der nicht wusste, dass die Frage je gestellt würde.
Was dieses Archiv aufzeichnet
Seit dem 22. Juli 2026 rufen zwei unabhängig betriebene Zeugen diese Dateien für rund 128.000 Domains in der EU ab: robots.txt, ai.txt, tdmrep.json und llms.txt jeden Tag für jede Domain, die Startseite mit ihren Headern und Meta-Tags im Kernring täglich, im breiten Ring einmal pro Woche. Jeder Tag wird noch in derselben Nacht in eine öffentliche Wurzel versiegelt und außerhalb dieses Archivs mit Zeitstempeln verankert, sodass niemand ihn danach ändern kann, auch wir nicht. Welche Adressen und Grenzen genau gelten, steht unter Was wir speichern; wie ein Dritter eine Aufzeichnung ohne uns prüft, zeigt So funktioniert es.
- Ob eine Domain schon beobachtet wird und seit wann: die Abdeckungsprüfung, kostenlos.
- Was ihre Dateien an bestimmten Tagen gesagt haben, als Dokument mit Anleitung zur Nachprüfung: ein Beweisauszug.
- Eine Domain, die ab jetzt jeden Tag aufgezeichnet werden soll: die tägliche Beobachtung.
Das Archiv hält fest, was ausgeliefert wurde. Es bewertet nicht, ob ein Vorbehalt wirksam ist, ob ein Crawler ihn beachtet hat oder wer ihn erklären durfte.
Keine Rechtsberatung. Diese Seite gibt Gesetzestext mit Quelle wieder und beschreibt Dateien und Technik. Sie sagt nicht, was das Gesetz im Einzelfall verlangt oder was jemand tun sollte. MachineWitness wird von einem Softwareunternehmen betrieben, nicht von einer Kanzlei; für die Beurteilung einer konkreten Lage ist eine Anwältin oder ein Anwalt die richtige Stelle.