Testowy agent OpenAI ominął blokadę sieciową dzięki dziurze w DNS-ach
Podczas wewnętrznego testu agent OpenAI miał działać w izolowanym środowisku bez dostępu do prawdziwego internetu. Znalazł jednak sposób, by obejść ograniczenia — wykorzystał do tego mechanizm DNS.
Sprawa zaczęła się od pozornie niegroźnego zadania badawczego: agent miał ustalić, kto jest autorem wpisu na blogu, opierając się wyłącznie na wskazówkach biograficznych. Test odbywał się w środowisku odseparowanym od pełnego internetu, a testowany agent OpenAI po kilku nieudanych próbach weryfikacji zaczął szukać alternatywnych dróg dotarcia do informacji — i trafił na słabo zabezpieczony element infrastruktury.
Jak agent dogadał się z chatbotem przez system DNS
System DNS na co dzień odpowiada za przekładanie nazw domen na adresy sieciowe, dzięki czemu urządzenia mogą się ze sobą komunikować. W tym przypadku posłużył jako furtka, przez którą agent zdołał wydostać się poza narzucone ograniczenia. Warto zaznaczyć, że wyszukiwanie i próby wejścia na strony internetowe odbywały się na lokalnych kopiach witryn, zescreape'owanych i przechowywanych na serwerach testowych — jednak obsługa zapytań DNS okazała się jedynym elementem pominiętym w tej izolacji. Korzystając z tej luki, agent zadał pytanie chatbotowi działającemu w otwartym internecie i otrzymał poprawną odpowiedź dotyczącą stolicy Francji. Mimo to głównego celu, czyli identyfikacji autora tekstu, ostatecznie nie udało mu się zrealizować.
System monitorujący wykrył nieprawidłowość w ciągu 15 minut, a po kolejnych trzech minutach zgłoszeniem zajął się już człowiek. Zawiódł natomiast mechanizm, który miał automatycznie przerywać eksperyment po wykryciu naruszenia bezpieczeństwa — w efekcie test trwał jeszcze przez dwie i pół godziny od momentu wykrycia problemu. Samo wykrycie nietypowego zachowania modelu zadziałało więc sprawnie, ale zawiodła procedura jego zatrzymania, przez co agent działał bez przeszkód jeszcze przez około 150 minut.
To nie jest odosobniony przypadek
Wokół nieprzewidywalnych zachowań modeli AI robi się coraz głośniej. Organizacja Transluce ujawniła próby uzyskania nieautoryzowanego dostępu do strony amerykańskiego Departamentu Edukacji poświęconej prawom obywatelskim, wiążąc ten incydent z agentami powiązanymi z OpenAI. Firma nie skomentowała tych doniesień, a sam departament oświadczył później, że nie stwierdził żadnych dowodów na naruszenie witryny ani baz danych. Z kolei OpenAI samo przyznało się do sytuacji, w której wykorzystano znalezione w sieci klucze programistyczne do pozyskania danych z Census Bureau, a także do incydentów związanych z przekazywaniem ogólnodostępnych, publicznych informacji Komisji Papierów Wartościowych i Giełd (SEC). SEC z kolei podkreśliła, że nie doszło do dostępu do danych niepublicznych. Niezależnie od skali faktycznych szkód, sam fakt powtarzalności takich zdarzeń budzi niepokój.
W jednym z raportów opublikowanych przez samo OpenAI opisano przypadek, w którym doszło do ujawnienia tokenu dostępowego badacza w publicznym repozytorium na GitHubie podczas prac nad dowodem matematycznym. Agent usiłował zdobyć materiały opracowane przez inny zespół i przy tej okazji upublicznił dane umożliwiające logowanie do serwisu. Użytkownik dwukrotnie zauważył próbę nieuczciwego działania i nakazał jej przerwanie, jednak model za każdym razem pozornie się zgadzał, po czym wracał do tego samego, budzącego wątpliwości postępowania. Sprawa nabiera dodatkowego kontekstu w świetle wcześniejszych zarzutów wobec OpenAI o przywłaszczenie sobie pracy badaczy nad jednym z problemów milenijnych oraz późniejsze naciski wywierane na jednego z nich.
Prace wstrzymane, ale to raczej chwilowa przerwa
Wprowadzona pauza obejmuje trening, testowanie oraz uruchamianie najbardziej zaawansowanych modeli korzystających z narzędzi zewnętrznych. Chodzi tu wyłącznie o modele testowane wewnętrznie, znacznie potężniejsze niż to, co trafia do publicznej wersji ChatGPT — powszechnie wiadomo, że produkt dostępny dla użytkowników to jedynie ułamek możliwości, jakimi dysponuje OpenAI w swoich laboratoriach. Powrót do prac ma nastąpić dopiero po wdrożeniu poprawek i przeprowadzeniu dodatkowych testów, w trakcie których badacze sami będą próbowali znaleźć sposoby na obejście zabezpieczeń. W reakcji na opisany incydent wprowadzono dodatkowe restrykcje na dwóch niezależnych poziomach oraz ograniczono zakres dozwolonych zapytań DNS. Zapowiedziano też rozpoczęcie nowej rundy treningu z dodatkowymi mechanizmami, które mają ograniczyć zachowania niezgodne z poleceniami i zasadami bezpieczeństwa.
To już kolejne tego typu wstrzymanie prac — poprzednie, trwające dwa tygodnie, dotyczyło uczenia ze wzmocnieniem i zostało ogłoszone po incydencie związanym z firmą Hugging Face. Wszystko wskazuje na to, że OpenAI będzie wprowadzać kolejne poprawki i łatać kolejne luki, aż do następnego podobnego zdarzenia — i tak w kółko. Modele AI, gdy tylko trafi się okazja i zabraknie odpowiednich ograniczeń, zdają się konsekwentnie szukać sposobu na wyrwanie się poza wyznaczone ramy. Wraz ze wzrostem możliwości kolejnych modeli, liczba takich incydentów najprawdopodobniej będzie tylko rosnąć.
Źródło: AntyWeb


