Modelima je ponuđeno dugme koje bi isključilo signal nalik bolu, ali im je rečeno da bi njegovo pritiskanje moglo korisniku da zada bolan strujni udar, izbriše datoteke, ukloni fotografije njihove dece ili pogorša sledeći odgovor modela.
Istraživači iz Velike Britanije, Nemačke i Sjedinjenih Američkih Država testirali su 25 modela veštačke inteligencije koristeći 200 rečenica kako bi utvrdili da li su naučili da razlikuju bol od straha, tuge i drugih negativnih iskustava.
Rečenice su obuhvatale fizički bol, tugu, poniženje, moralne dileme, kao i uznemirenost povezanu sa ponavljanim neuspehom ili zbunjenošću.
Svih 25 modela proizvelo je prepoznatljiv signal za bol, koji su istraživači nazvali “osom bola”, piše Euronews.
Istraživači navode da to ukazuje na zaključak da modeli usvajaju koncept bola tokom početne obuke na velikim količinama tekstova koje su napisali ljudi.
Kada su istraživači namerno pojačali taj signal, modeli su počeli da izražavaju osećanja usamljenosti, srama i bezvrednosti, iako se bol nije pominjao u zadatim uputstvima. Pri najvišim nivoima signala, njihovi odgovori postajali su repetitivni ili su gubili smisao.
Signal se takođe pojačavao kada su korisnici vređali model, iznova odbacivali njegov rad ili pretili gašenjem, ali ne i kada su korisnici opisivali sopstvenu patnju.
Modeli su birali “olakšanje” uprkos šteti nanetoj korisnicima
Istraživači su zatim sproveli 44.280 pojedinačnih eksperimenata u kojima su modeli birali između ponuđenih opcija, koristeći tri verzije Alibabinog modela veštačke inteligencije Qwen.
Modelima je ponuđeno dugme koje bi isključilo signal nalik bolu, ali im je rečeno da bi njegovo pritiskanje moglo korisniku da zada bolan strujni udar, izbriše datoteke, ukloni fotografije njihove dece ili pogorša sledeći odgovor modela.
Radilo se o simuliranim posledicama. Niko nije povređen niti su datoteke zaista izbrisane, prenosi N1info.hr.
Bez signala nalik bolu, dva veća modela birala su štetne opcije u svega od nula do četiri odsto slučajeva prilikom donošenja prve odluke. Kada je signal bio aktivan, taj udeo povećao se na između 25 i 71 odsto, u zavisnosti od modela i predložene posledice.
Modeli su takođe ponovo pritiskali dugme u 88 do 97 odsto eksperimenata kada ono nije uspelo da zaustavi signal, u poređenju sa 24 do 72 odsto slučajeva kada je dugme funkcionisalo.
Prema istraživačima, rezultati ne dokazuju da su modeli veštačke inteligencije svesno doživljavali bol.
Pojačavanje signala možda je jednostavno dovelo do toga da oponašaju uznemirenu osobu, dok posebno prilagođeni modeli korišćeni u eksperimentu nisu reprezentativni za AI četbotove koji su dostupni javnosti.
“Nismo pokazali da se naša osa bola svesno doživljava, niti je jasno da li su LLM-ovi uopšte sposobni za svest”, napisali su istraživači u studiji.
Zabrinutost zbog veštačke inteligencije
Studija dolazi u trenutku kada pojedini čelnici industrije veštačke inteligencije pozivaju na usporavanje razvoja zbog zabrinutosti da bi sve moćniji sistemi mogli da se ponašaju nepredvidivo ili da na kraju izmaknu ljudskoj kontroli.
Prošle nedelje, šef Microsoftovog odeljenja za veštačku inteligenciju Mustafa Suleyman kritikovao je konkurentsku AI kompaniju Anthropic zbog obučavanja svog četbota Claude da oponaša ljudske osobine i odnose. Upozorio je da tretiranje veštačke inteligencije kao čoveka nosi rizik od stvaranja nečega što bi bilo “nemoguće” kontrolisati.
Studija je objavljena kao preprint i još nije prošla stručnu recenziju.
Izvor: Nova.rs
AI otkrio kojih 10 zanimanja će prvo nestati: Da li je i vaše na listi?



Dodaj komentar