Common Crawl-datasetet granskas nu hårdare efter att rättighetsinnehavare tvingat fram borttagning av över två miljoner skrapade nyhetsartiklar. Åtgärden markerar en av de mest betydande upphovsrättsutmaningarna hittills inom AI-träning. Utvecklare och stora modellbyggare står nu inför ökat tryck att granska hur de samlar in data och säkerställa att informationen de använder följer upphovsrättslagar. Vad utlöste borttagningen…