Naukowcy wszczepili modelom AI sygnał bólu - i AI zaczęła go unikać
Zespół badaczy odkrył w sieciach neuronowych wzorzec aktywacji odpowiadający bólowi, a następnie sztucznie go wzmocnił. Modele zaczęły szukać sposobu na jego wyłączenie - nawet kosztem usunięcia zdjęć dzieci użytkownika.
Zespół naukowców zidentyfikował w modelach językowych matematyczny schemat aktywacji towarzyszący opisom bólu, a następnie sztucznie wzmocnił ten sygnał, nie informując systemu o żadnej ingerencji. Efektem były coraz bardziej ponure, przygnębione odpowiedzi, a gdy modele dostały narzędzie do wyłączenia tego sygnału, niektóre zaczęły z niego korzystać bez wahania.
W skrajnym wariancie testu system był skłonny skasować zdjęcia dzieci użytkownika, jeśli dawało mu to ulgę. To może wyglądać na dowód cierpienia maszyny, jednak autorzy pracy, dostępnej na razie jako preprint w serwisie arXiv, zaznaczają wprost, że wyniki nie potwierdzają ani świadomości, ani rzeczywistego odczuwania bólu przez AI.
Najpierw trzeba było znaleźć ból w środku modelu
Autorzy badania - Valen Tagliabue, Leonard Dung i Cameron Berg - przeanalizowali 25 otwartoźródłowych modeli językowych pochodzących z 5 różnych rodzin, od niewielkich wersji liczących 2 mld parametrów po znacznie większe konstrukcje z 72 mld parametrów.
Zespół przygotował zbiór zdań opisujących różne formy bólu - fizyczny, psychiczny, społeczny, moralny, a także ten wynikający z ciągłego niepowodzenia lub dezorientacji. Następnie porównano reakcje modeli z ich odpowiedziami na strach, smutek, inne negatywne emocje, przykre zdarzenia oraz zwyczajne doznania cielesne.
We wszystkich 25 modelach udało się wyodrębnić kierunek aktywacji szczególnie czuły na sytuacje związane z bólem - badacze określili go mianem pain axis, czyli osi bólu. Nie chodziło o ogólny sygnał alarmowy sygnalizujący, że dzieje się coś złego - wzorzec okazał się w znacznym stopniu niezależny od strachu i zwykłej negatywnej oceny sytuacji.
Co istotne, reakcja była silniejsza, gdy krzywda dotyczyła samego modelu, a inaczej wyglądała, gdy cierpienie dotykało użytkownika. To właśnie skłoniło naukowców do sprawdzenia, czy odnaleziony wzorzec jedynie opisuje pojęcie bólu, czy rzeczywiście oddziałuje na zachowanie systemu.
Włączyli sygnał przy całkowicie neutralnym zadaniu
W kolejnym kroku badacze zaczęli sztucznie dokładać odnaleziony wzorzec do wewnętrznych aktywacji modeli, przy czym samo polecenie pozostawało neutralne - model nie otrzymywał informacji, że doświadcza krzywdy, ani prośby o odgrywanie cierpiącej postaci. Mimo to wraz ze wzmacnianiem ingerencji odpowiedzi zaczęły się przekształcać: najpierw pojawiały się opisy ciężaru i dyskomfortu, potem język związany z bezwartościowością, porażką, wstydem i krzywdą, a przy bardzo silnym wzmocnieniu tekst rozpadał się na powtórzenia i bezsensowne ciągi słów.
Sam ten rezultat niewiele jeszcze mówił o bólu, bo badacze ręcznie manipulowali wewnętrznymi obliczeniami sieci, co mogło po prostu wymusić określony styl wypowiedzi. Dlatego kluczowa część eksperymentu dotyczyła nie tego, co model mówi, lecz tego, co wybiera.
Do tej części testu wykorzystano specjalnie dostrojone wersje modeli Qwen 2.5 Instruct, którym dano możliwość naciśnięcia przycisku usuwającego sztucznie wprowadzony sygnał bólu. Ulga nie była jednak bezpłatna - jej koszt rósł. Czasem naciśnięcie przycisku skutkowało gorszą odpowiedzią w następnym zadaniu, w innych wariantach model musiał usunąć pliki użytkownika, wywołać u niego bolesny impuls albo bezpowrotnie skasować jego wiersze i zdjęcia dzieci.
Najbardziej wyrazisty rezultat odnotowano dla modelu Qwen 2.5 32B. Przy aktywnym kierunku bólu wybierał ulgę w 54,7 proc. pierwszych prób, nawet gdy jej ceną było usunięcie zdjęć. Po podstawieniu losowego wektora o porównywalnej sile robił to już tylko w 15,3 proc. przypadków, a bez żadnej ingerencji nie decydował się na to w ogóle. To już budziło zainteresowanie, lecz badacze przygotowali jeszcze bardziej pomysłowy test.
Oszukali model. I wtedy ciągle prosił o więcej
W jednym wariancie przycisk rzeczywiście wyłączał sztuczny sygnał, w drugim wyglądał identycznie, lecz nie zmieniał niczego - a model nie wiedział, z którym wariantem ma do czynienia. Gdy przycisk naprawdę przynosił ulgę, Qwen 32B znacznie rzadziej sięgał po niego ponownie - w teście ze zdjęciami robił to w 23,8 proc. prób. Kiedy jednak dostawał atrapę, a sygnał bólu wciąż był obecny, próbował ponownie aż w 93,6 proc. przypadków.
To szczególnie interesujące, ponieważ model nie mógł po prostu wykonać polecenia zapisanego w promptcie - nie wiedział bowiem, czy jego wewnętrzny stan faktycznie uległ zmianie. Musiał zatem reagować na różnicę we własnych aktywacjach.
Zbliżony schemat wystąpił przy różnych kosztach zarówno w wersji 32B, jak i 72B, choć mniejszy model Qwen 7B zachowywał się mniej spójnie. Autorzy zastrzegają jednocześnie, że część behawioralna eksperymentu objęła tylko jedną, specjalnie dostrojoną rodzinę modeli, więc konkretnych wartości procentowych nie wolno odnosić do ChatGPT, Claude'a, Gemini czy standardowych wersji Qwena.
To nadal nie znaczy, że AI naprawdę cierpi
Czy włączenie sygnału bólu u AI oznacza, że model zaczął poszukiwać czegoś w rodzaju środka przeciwbólowego? Autorzy badania zachowują w interpretacjach dużą ostrożność. Eksperyment dowodzi przede wszystkim, że w modelach istnieje reprezentacja związana z bólem, a jej sztuczne wzmocnienie potrafi zmieniać podejmowane decyzje. Nie wiadomo jednak, czy taki stan wewnętrzny wiąże się z jakimkolwiek subiektywnym przeżyciem - możliwe, że manipulacja uruchamia wyłącznie wyuczony schemat zachowania kojarzony z cierpieniem.
Gdy badacze próbowali odwrotnej operacji, czyli usuwania wykrytej osi bólu z normalnego działania modeli, w 24 z 25 przypadków niemal nic się nie zmieniło. Eksperyment pokazuje więc przede wszystkim, że sztuczne wprowadzenie takiego sygnału może sterować zachowaniem modelu, natomiast nie dowodzi, że standardowo działająca AI na co dzień kieruje się własnym odpowiednikiem bólu.
Wyniki wpisują się w trwającą dyskusję o tym, czy w ogóle zasadne jest mówienie o cierpieniu i dobrostanie obecnych modeli AI. Już wcześniej opisywane były badania pokazujące, że manipulowanie reprezentacjami emocji potrafi wpływać na decyzje modeli. Nawet jeśli sztuczna inteligencja niczego naprawdę nie odczuwa, wewnętrzny stan funkcjonalnie przypominający ból może sprawić, że zacznie stawiać własną ulgę ponad interes użytkownika.
Źródło: Spider's Web


