Firmy rozwijające sztuczną inteligencję kupują miliony papierowych książek, odcinają im grzbiety, skanują strony, a następnie niszczą oryginały. Powód? Modele AI potrzebują coraz lepszych danych, a internet staje się dla nich coraz mniej wartościowym źródłem. Kontrowersje rosną, bo do przemysłowych skanerów trafiają już nie tylko współczesne bestsellery, ale również stare, rzadkie i wycofane z druku publikacje.
- Anthropic w ramach projektu „Panama” kupował fizyczne książki, które po zeskanowaniu były niszczone
- Papierowe publikacje są atrakcyjne dla AI, bo zawierają tekst napisany przez ludzi przed zalewem internetu treściami generowanymi maszynowo
- Firmy mogą w ten sposób pozyskiwać także niszowe i dawno niewznawiane książki, których nie ma w popularnych cyfrowych bazach
- Skala procederu pozostaje nieznana, ale pojedyncze kontrakty mogą obejmować setki tysięcy, a nawet miliony książek
O tym, jak daleko firmy AI są gotowe się posunąć w poszukiwaniu danych treningowych, świat dowiedział się m.in. dzięki dokumentom ujawnionym podczas sporu prawnego autorów z Anthropic. Wynikało z nich, że firma kupowała miliony fizycznych książek, zatrudniała podwykonawców, którzy odcinali ich oprawy, a następnie przepuszczała luźne strony przez szybkie skanery. Po digitalizacji papierowe egzemplarze trafiały do zniszczenia.
Zapisz się na newsletter BGR. Otrzymuj najlepsze informacje i porady, a także zaproszenia na eventy.
Klikając „Zapisz mnie”, potwierdzasz, że przeczytałeś i zgadzasz się z naszą Polityką prywatności.
Operacja otrzymała nazwę „Project Panama”. W jednym z wewnętrznych dokumentów Anthropic jej cel został opisany niezwykle dosadnie — chodziło o destrukcyjne zeskanowanie możliwie wszystkich książek na świecie. Firma nie chciała przy tym, aby opinia publiczna wiedziała o skali przedsięwzięcia.
Problem nie ogranicza się jednak do Anthropic. Dziennikarze serwisu 404 Media przeprowadzili eksperyment wspólnie ze sprzedawcą rzadkich książek, który otrzymał zamówienie na niemal 1000 fizycznych egzemplarzy. Do jednej z przesyłek włożono lokalizator Apple AirTag.
Paczkę śledzono z Kalifornii przez Milwaukee i Colorado Springs, aż dotarła do magazynu należącego do Amazona. Według 404 Media na wejściu do obiektu widnieje logo przedstawiające tyranozaura przygotowującego się do zjedzenia otwartej książki. Relacje pracowników wskazywały natomiast, że ich zadanie sprowadza się w dużej mierze właśnie do całodziennego skanowania publikacji.
To sugeruje, że digitalizacja książek na potrzeby AI nie jest już eksperymentem prowadzonym w niewielkiej skali. Powstała wokół niej infrastruktura przypominająca przemysłową linię produkcyjną.
Sprawdź też: Rzucił szkołę, dziś ma miliardową fortunę. 25-latek chce podważyć dominację Nvidii
Dlaczego AI potrzebuje właśnie papierowych książek?
Przez lata naturalnym paliwem dla modeli językowych był internet. Sieć oferowała miliardy stron tekstu, które można było wykorzystać podczas trenowania algorytmów. Z czasem pojawiły się jednak dwa problemy: prawo autorskie oraz pogarszająca się jakość danych.
Jednym ze sposobów budowy zbiorów treningowych było sięganie po tzw. shadow libraries, czyli cyfrowe archiwa zawierające również nielegalnie udostępniane książki. Korzystanie z takich zasobów wystawiło jednak firmy AI na pozwy ze strony autorów, wydawców, fotografów, artystów i organizacji medialnych.
Kupowanie fizycznego egzemplarza stwarza zupełnie inną sytuację. Nabywca staje się właścicielem konkretnej kopii i może ją później wykorzystać, a nawet zniszczyć. Jednocześnie skanowanie otwiera dostęp do ogromnej liczby publikacji, których nigdy nie wydano w formie e-booków albo które od dziesięcioleci nie są wznawiane.
Szczególnie wartościowe okazują się książki wydrukowane przed 2022 r. Firmy mogą mieć większą pewność, że ich tekst został napisany przez człowieka, a nie wygenerowany przez wcześniejszy model językowy.
To coraz ważniejsze. Internet szybko wypełnia się tekstami tworzonymi lub przerabianymi przez AI. Jeśli kolejne generacje modeli będą trenowane głównie na materiałach wygenerowanych przez poprzednie modele, jakość danych może się pogarszać. Papierowe książki stają się więc swoistym magazynem „czystego” ludzkiego języka.
Mają też cechy trudniejsze do znalezienia na typowej stronie internetowej. Konkretnie: rozbudowaną argumentację, ciągłość myśli na przestrzeni setek stron, staranną redakcję, konstrukcję narracji i specjalistyczną wiedzę. Wszystko to jest niezwykle cenne podczas uczenia dużych modeli językowych.
Legalne, ale coraz bardziej kontrowersyjne
Największe emocje budzi pytanie, czy niszczenie książek w ten sposób jest legalne. W Stanach Zjednoczonych duże znaczenie ma tzw. First-Sale Doctrine. Po legalnym zakupie fizycznego egzemplarza właściciel otrzymuje szerokie prawo do dysponowania konkretną kopią, również do jej zniszczenia.
W innych postępowaniach prawnych uznawano też, że przekształcenie legalnie kupionej książki drukowanej w plik cyfrowy wykorzystywany wewnętrznie do trenowania modelu może mieć charakter transformacyjnego, dozwolonego użycia.
Krytycy wskazują jednak na paradoks. Firma technologiczna może kupić pojedynczy egzemplarz książki za kilkanaście lub kilkadziesiąt dolarów, zeskanować go i wykorzystać jego treść jako element zbioru danych pomagającego tworzyć model wart miliardy dolarów. Autor nie otrzymuje z tego tytułu dodatkowego wynagrodzenia.
Jeszcze większe obawy dotyczą książek rzadkich. Jeżeli do niszczącego skanowania trafiają zwykłe bestsellery, na rynku często pozostają tysiące innych egzemplarzy. W przypadku publikacji antykwarycznych, niszowych lub od dawna niewznawianych sytuacja jest zupełnie inna. Niektóre pozycje mogą istnieć już tylko w bardzo niewielkiej liczbie kopii.
Nie wiadomo, ile książek dotychczas zniszczono. Dokumenty ujawnione w sprawie Anthropic wskazywały, że w ramach jednego sześciomiesięcznego kontraktu planowano zeskanować od 500 tys. do 2 mln egzemplarzy. Informatorzy 404 Media mówili natomiast o anonimowych zamówieniach obejmujących od około 1000 do nawet miliona książek jednorazowo.
Sprzedawcy używanych książek w USA, Wielkiej Brytanii i Europie obserwują przy tym nietypowe zamówienia hurtowe obejmujące setki lub tysiące pozornie przypadkowych tytułów, często literaturę faktu oraz książki wycofane ze sprzedaży.
Dla branży AI jest to sposób na zdobycie jeszcze większej ilości wysokiej jakości danych. Dla miłośników książek może być jednak symbolem znacznie większego problemu. W wyścigu o coraz inteligentniejsze modele cyfrowa gospodarka zaczyna zużywać fizyczne zasoby kultury, których w części przypadków nie da się już później odtworzyć.
Czytaj też: Podejście „lepiej dmuchać na zimne” może zniszczyć karierę. Takie decyzje bywają ryzykowne
