Conform HotNews: Tehnologia AI distruge cărți în SUA pentru antrenarea modelelor lingvistice
Companii din domeniul inteligenței artificiale cheltuiesc milioane de dolari pe cărți fizice, le distrug prin tăierea cotoarelor pentru a putea scana rapid paginile necesare antrenării modelelor lingvistice de mari dimensiuni, după care aruncă resturile. Această practică, denumită „scanare distructivă”, este posibilă datorită unei particularități a legislației americane privind drepturile de autor. Un tribunal din SUA a stabilit că scanarea cărților pentru antrenarea inteligenței artificiale intră sub incidența doctrinei „fair use” (utilizare rezonabilă).
Legislația americană permite distrugerea cărților
Pentru a evita încălcarea legii privind drepturile de autor, companiile precum ANTHROPIC sunt obligate să distrugă exemplarele fizice ale cărților după scanare. Astfel, înainte de procesul de scanare există un singur exemplar al cărții, iar după scanare rămâne doar copia digitală. Această interpretare a legislației americane consideră că nu are loc nicio încălcare a drepturilor de autor, deoarece nu există o multiplicare a exemplarelor fizice. Investigații recente au dezvăluit că astfel de comenzi masive de cărți ajung la unități Amazon din LAS VEGAS, unde sunt supuse procesului de „scanare distructivă” pentru antrenarea modelelor lingvistice la care lucrează compania fondată de JEFF BEZOS. Deși AMAZON nu este un jucător major în domeniul AI, dezvoltarea acestei tehnologii este esențială pentru creșterea vânzărilor în comerțul electronic și optimizarea afacerii de cloud computing.
Anticarii din Canada, suspicioși de comenzile masive
În CANADA, proprietarii de librării au început să primească solicitări „foarte suspecte” pentru cantități mari de cărți. PETER SELLERS, proprietarul librăriei SELLERS & NEWEL din TORONTO, povestește cum, inițial, comenzile masive veneau de la designeri de interior sau platouri de filmare. Însă, în ultimele luni, au început să apară solicitări cu liste de cărți aparent aleatorii, care i-au ridicat semne de întrebare. SELLERS a primit un mesaj pe LINKEDIN de la o companie numită INNODATA, care căuta să achiziționeze volume mari de cărți second-hand. După ce a citit un articol despre scanarea cărților pentru antrenarea AI, SELLERS a înțeles brusc motivația din spatele acestor cereri neobișnuite. Personalul librăriei sale este acum mult mai atent la astfel de solicitări, refuzând comenzile mari dacă nu provin de la parteneri legitimi și cu un scop clar definit.
Comenzi bizare alimentează industria AI
Alți vânzători de cărți din întreaga lume au raportat primirea unor solicitări similare, adesea pentru cărți educaționale obscure, care stătuseră nevândute ani de zile. Unii anticari recunosc că este greu să refuze aceste oferte, mai ales într-o industrie aflată în dificultate financiară. Numele companiilor care fac aceste solicitări par să se schimbe frecvent, iar niciun cumpărător nu a recunoscut public că furnizează cărți către companii de AI. Compania ZOOM BOOKS, cu sediul în BRITISH COLUMBIA, este menționată frecvent pe forumurile online ca fiind un important achizitor de cărți în volume mari, cu scopuri neclare. Vânzători din Spania, Germania, AUSTRALIA, NOUA ZEELANDĂ și Marea Britanie și-au exprimat suspiciunea că ordinele ZOOM sunt destinate scanării pentru AI, deși nu există dovezi concrete în acest sens. PATRICK HEMPELMANN, proprietarul librăriei BMV BOOKS din TORONTO, a declarat pentru CBC că ZOOM a început să cumpere sute de cărți de la el acum aproximativ șase luni, în special cărți tehnice specializate și manuale medicale sau de matematică/fizică postuniversitară, care stătuseră pe rafturi timp de un deceniu.
Nevoia de conținut uman pentru AI
Cărțile fizice, publicate înainte de lansarea CHATGPT în 2022, sunt esențiale pentru companiile de AI. Experții sunt îngrijorați că modelele lingvistice se degradează atunci când sunt antrenate repetat pe propriile rezultate. Prin urmare, este necesar conținut nou, garantat a fi scris de oameni, pentru a evita erorile și informațiile false. Modelele AI timpurii au generat numeroase „halucinații”, adică informații complet inventate. Antrenarea modelelor noi pe texte ce conțin astfel de informații false riscă să vicieze profund rezultatele obținute.
Sursa: HotNews

Fii primul care comentează