Tko je autor AI slike? MIT-ova studija otkriva da odgovora često nema

Istraživanje objavljeno u časopisu Nature Communications uvodi pojam „propadanja atribucije": što je model veći, to je teže dokazati da je pojedina slika utjecala na njegov rezultat
2 - 3 minute

Kad generator umjetne inteligencije stvori sliku, čije je djelo u njoj?

Pitanje stoji u srcu brojnih sudskih sporova, pregovora o licencama i prijedloga zakona diljem svijeta, a nova studija istraživača s MIT-ova Laboratorija za računalne znanosti i umjetnu inteligenciju (CSAIL) sugerira da za dovoljno velike modele odgovor često i ne postoji. Rad je objavljen u časopisu Nature Communications, a nalaz mu je jasan već iz naslova: izlazni rezultati generativnih difuzijskih modela često su nepovezivi s izvorom.

Autori Zheng Dai i David Gifford fenomen su nazvali „propadanjem atribucije". Riječ je o tome da, kako skup podataka za treniranje raste, utjecaj svake pojedine slike na konkretan rezultat postaje sve teže uočljiv, sve dok gotovo posve ne iščezne. „Ako uklonite dio podataka, a rezultat modela se ne promijeni, onda taj dio nije utjecao na rezultat", objasnio je Dai. „Pa nema smisla pripisivati mu taj rezultat."

Do zaključka su došli metodom koju opisuju kao prvu koja omogućuje precizno, a ne približno uklanjanje podataka iz modela. U nizu pokusa istraživači su iz skupova za treniranje uklanjali pojedine slike, pa i cjelokupan opus pojedinog umjetnika ili sve fotografije određene osobe, i promatrali mijenja li se generirani rezultat. Testirali su modele trenirane na skupovima od svega 256 slika pa sve do više od 160.000, a u jednom su pokusu sliku generirali koristeći djela 744 umjetnika te potom svakog od njih redom uklanjali. Utjecaj pojedine slike smanjivao se po zakonu obrnute potencije: što je model veći, to manje ovisi o bilo kojem svom izvoru.

Nalaz izravno dotiče pravnu raspravu o autorstvu. Kako je za MIT-ove medije prokomentirao James Grimmelmann, profesor prava na Cornell Law School i Cornell Tech, kad bi atribucija radila, pouzdano bi govorila je li sličnost između rezultata modela i zaštićenog djela posljedica kopiranja ili slučajnosti, no ovaj rad daje razlog za sumnju da će atribucija zakazati upravo kod velikih, zanimljivih modela. Studija pokazuje da kod takvih modela sličnost može nastati a da nijedno konkretno djelo ne nosi dovoljnu težinu da ga se nazove izvorom, jer model uči široke vizualne obrasce, poput kompozicije, osvjetljenja i tekstura, iz milijuna slika odjednom.

Ipak, autori izričito upozoravaju da njihov nalaz ne znači da modeli nikada ne kopiraju. Modeli i dalje mogu zapamtiti i doslovno reproducirati pojedine primjere iz skupa za treniranje, a atribucija je moguća i kod velikih skupova podataka. Studija također ne rješava širu raspravu o tome smiju li tvrtke uopće koristiti materijal zaštićen autorskim pravom bez dopuštenja. Njezin je doseg uži: pokazuje da je često teško dokazati da je baš određena slika izravno utjecala na baš određeni rezultat.

Važno je i ograničenje koje autori sami navode. Istraživanje se odnosi na difuzijske modele, koji su danas glavni alat za generiranje slika i videa, ali ne i na velike jezične modele oko kojih se vode najveći autorskopravni sporovi. Vrijedi li isto „propadanje atribucije" i za njih, ostaje otvoreno pitanje. Za sada studija ne nudi jednostavan odgovor u raspravi o autorskim pravima, nego prije upozorava na jaz između načina na koji strojno učenje funkcionira i tradicionalnih predodžbi o autorstvu.

Izvor: heng Dai i David Gifford, „Outputs of generative diffusion models are often unattributable", Nature Communications (open access); priopćenje i blog MIT CSAIL-a; izjava J. Grimmelmanna prema MIT News

Stavovi iznešeni u člancima, kolumnama i komentarima su osobni stavovi autora i ne odražavaju nužno stav redakcije portala infopix.hr.

Pratite nas na Facebook stranici, Instagram profilu, YouTube kanalu i TikToku te se pridružite našoj Facebook grupi i raspravljajte s nama o aktualnim temama.

Imate priču? Javite nam se na redakcija@infopix.hr