Der Common-Crawl-Datensatz gerät zunehmend unter Druck, nachdem Rechteinhaber die Entfernung von mehr als zwei Millionen gescrapten Nachrichtenartikeln durchgesetzt haben. Dieser Schritt markiert eine der bedeutendsten urheberrechtlichen Auseinandersetzungen im Bereich des KI-Trainings bisher. Entwickler und Betreiber großer Modelle stehen nun unter höherem Druck, ihre Datenquellen zu überprüfen und sicherzustellen, dass verwendete Inhalte urheberrechtskonform sind. Was die…