Common Crawl-datasettet står nå overfor sterkere gransking etter at rettighetshavere fikk fjernet mer enn to millioner skrapede nyhetsartikler. Tiltaket markerer en av de mest betydelige opphavsrettsutfordringene i AI-trening så langt. Utviklere og aktører som bygger store modeller møter nå økt press for å undersøke hvordan de henter inn data og sikre at informasjonen de bruker…