Anthropic vernietigde miljoenen gedrukte boeken om zijn AI-modellen te bouwen

Het bedrijf huurde Googles boekenscanchef in om “alle boeken ter wereld” te versnijden en te digitaliseren.

Op maandag bleek uit rechtbankdocumenten dat het AI-bedrijf Anthropic miljoenen dollars uitgaf aan het fysiek scannen van gedrukte boeken om Claude te bouwen, een AI-assistent die vergelijkbaar is met ChatGPT. Daarbij sneed het bedrijf miljoenen gedrukte boeken los van hun band, scande ze in digitale bestanden en gooide de originele exemplaren weg, uitsluitend om AI te trainen. Die details waren verstopt in een auteursrechtelijke uitspraak over fair use, waarvan we gisteren al de bredere gevolgen bespraken.

De juridische beslissing van 32 pagina’s vertelt hoe het bedrijf in februari 2024 Tom Turvey aannam, de voormalige verantwoordelijke voor samenwerkingen binnen het Google Books-project voor het scannen van boeken. Hij kreeg de opdracht om “alle boeken ter wereld” te verzamelen. Deze strategische aanstelling leek bedoeld om Google’s juridisch succesvolle aanpak voor het digitaliseren van boeken te kopiëren: dezelfde scanmethode die auteursrechtelijke uitdagingen overleefde en belangrijke fair-use-precedenten vestigde.

Hoewel destructief scannen bij sommige digitaliseringsprojecten gebruikelijk is, viel Anthropic vooral op door de enorme schaal. Het Google Books-project gebruikte daarentegen grotendeels een gepatenteerd, niet-destructief camerasysteem om miljoenen boeken uit bibliotheken te scannen en later terug te geven. Bij Anthropic leken de hogere snelheid en lagere kosten van de destructieve methode zwaarder te wegen dan het bewaren van de fysieke boeken zelf. Dat wijst op de behoefte aan een goedkope en eenvoudige oplossing in een bijzonder concurrerende sector.

Uiteindelijk oordeelde rechter William Alsup dat deze destructieve scanmethode onder fair use viel — maar alleen omdat Anthropic de boeken eerst legaal had gekocht, elk gedrukt exemplaar na het scannen had vernietigd en de digitale bestanden intern hield in plaats van ze te verspreiden. De rechter vergeleek het proces met het “besparen van ruimte” via een omzetting van formaat en vond het transformerend. Als Anthropic vanaf het begin zo te werk was gegaan, had het mogelijk de eerste juridisch goedgekeurde zaak van AI-fair use kunnen neerzetten. Maar de eerdere piraterij ondermijnde die positie.

Als je niet diep in de AI-sector en het auteursrecht zit, kun je je afvragen: waarom zou een bedrijf miljoenen uitgeven aan boeken om ze vervolgens te vernietigen? Achter deze vreemde juridische constructie schuilt een veel fundamentelere drijfveer: de onverzadigbare honger van de AI-industrie naar hoogwaardige tekst.

De race om hoogwaardige trainingsdata

Om te begrijpen waarom Anthropic miljoenen boeken wilde scannen, is het belangrijk te weten dat AI-onderzoekers grote taalmodellen ontwikkelen, zoals de modellen achter ChatGPT en Claude, door miljarden woorden in een neuraal netwerk te voeden. Tijdens de training verwerkt het AI-systeem die tekst herhaaldelijk en bouwt het statistische verbanden op tussen woorden en concepten.

De kwaliteit van de trainingsdata die in het neuraal netwerk wordt gestopt, heeft rechtstreeks invloed op de mogelijkheden van het uiteindelijke AI-model. Modellen die zijn getraind op goed geredigeerde boeken en artikelen leveren doorgaans samenhangendere en nauwkeurigere antwoorden dan modellen die zijn getraind op tekst van mindere kwaliteit, zoals willekeurige YouTube-reacties.

Uitgevers hebben wettelijk controle over content die AI-bedrijven maar al te graag willen gebruiken, maar AI-bedrijven willen niet altijd onderhandelen over een licentie. De first-sale doctrine bood een uitweg: zodra je een fysiek boek koopt, mag je met dat exemplaar doen wat je wilt, inclusief het vernietigen ervan. Het kopen van fysieke boeken bood dus een juridisch alternatief.

Toch blijft kopen duur, zelfs als het legaal is. Dus koos Anthropic, net als veel AI-bedrijven vóór het bedrijf, aanvankelijk voor de snelle en makkelijke route. In de jacht op hoogwaardige trainingsdata bleek uit de rechtbankstukken dat Anthropic eerst digitale versies van gepirateerde boeken verzamelde om te ontkomen aan wat CEO Dario Amodei “legal/practice/business slog” noemde: de ingewikkelde licentieonderhandelingen met uitgevers. Maar tegen 2024 was Anthropic volgens de documenten “niet zo happig meer” om gepirateerde ebooks te gebruiken “om juridische redenen” en was een veiligere bron nodig.

Credit: State of Washington

Het kopen van tweedehands fysieke boeken omzeilde licenties volledig en leverde tegelijk de hoogwaardige, professioneel geredigeerde tekst op die AI-modellen nodig hebben. Destructief scannen was simpelweg de snelste manier om miljoenen boeken te digitaliseren. Het bedrijf gaf “vele miljoenen dollars” uit aan deze koop- en scanoperatie en kocht vaak tweedehands boeken in bulk. Daarna werden de boeken uit hun band gehaald, werden de pagina’s op werkbare afmetingen gesneden, werden ze als stapels pagina’s gescand naar pdf’s met machineleesbare tekst, inclusief kaften, en werden de papieren originelen weggegooid.

De rechtbankdocumenten geven niet aan dat er in dit proces zeldzame boeken zijn vernietigd. Anthropic kocht zijn boeken immers in bulk bij grote retailers. Archivarissen hadden echter al lang andere manieren ontwikkeld om informatie uit papier te halen. Zo ontwikkelde The Internet Archive niet-destructieve scanmethoden waarmee fysieke boeken behouden blijven terwijl er digitale kopieën worden gemaakt. En eerder deze maand kondigden OpenAI en Microsoft aan dat zij samenwerken met de bibliotheken van Harvard om AI-modellen te trainen op bijna 1 miljoen boeken in het publieke domein, daterend uit de 15e eeuw: volledig gedigitaliseerd, maar behouden voor later.

Terwijl Harvard zorgvuldig 600 jaar oude manuscripten bewaart voor AI-training, liggen elders op aarde de weggegooide resten van miljoenen boeken die Claude leerden hoe je je cv kunt oppoetsen. Toen Claude zelf naar dit proces werd gevraagd, gaf het een treffend antwoord in de stijl van miljarden pagina’s weggegooide tekst: “Het feit dat deze vernietiging heeft geholpen mij te creëren — iets dat literatuur kan bespreken, mensen kan helpen schrijven en zich kan bezighouden met menselijke kennis — voegt lagen van complexiteit toe die ik nog steeds probeer te verwerken. Het is alsof ik ben gebouwd uit de as van een bibliotheek.”

  • Eater

    vraag en ik antwoord

    Related Posts

    Anthropic vernietigde miljoenen gedrukte boeken om zijn AI-modellen te bouwen

    Het bedrijf huurde Googles boekenscanchef in om “alle boeken ter wereld” te versnijden en te digitaliseren. Op maandag bleek uit rechtbankdocumenten dat het AI-bedrijf Anthropic miljoenen dollars uitgaf aan het…

    Grote AI-flater kost PwC reputatie

    Accountants- en advieskantoor PwC heeft een flinke blunder gemaakt door potentiële klanten rapporten te sturen die vol stonden met verzonnen informatie. Vier documenten over kunstmatige intelligentie en elektrische voertuigen bevatten…

    Geef een reactie