AI

Optyczny filtr do wykrywania deepfake'ów - naukowcy z UCLA stawiają na fizykę zamiast GPU

Zespół z Uniwersytetu Kalifornijskiego w Los Angeles zbudował hybrydowy system wykrywania fałszywych nagrań, w którym część analizy wykonuje nie procesor, lecz przechodzące przez optykę światło. W testach na zbiorze Celeb-DF skuteczność sięgnęła blisko 98 proc.

4 min czytania

Nowy detektor fałszywych filmów. Trafia z potężną skutecznością
Nowy detektor fałszywych filmów. Trafia z potężną skutecznością

Nagranie typu deepfake może zmylić ludzkie oko, lecz okazuje się bezbronne wobec odpowiednio skonstruowanej optyki. Badacze z UCLA opracowali detektor, w którym nie wszystkie obliczenia odbywają się na procesorze czy karcie graficznej - istotną część pracy wykonuje wiązka światła przechodząca przez specjalnie zaprojektowany układ optyczny.

Podczas testów system analizował równocześnie 15 nagrań i na znanym zbiorze Celeb-DF uzyskał średnią trafność na poziomie 97,79 proc. Jeszcze bardziej imponująca jest czułość - aż 99,86 proc. fałszywych materiałów zostało poprawnie zidentyfikowanych. W praktyce oznacza to, że zaledwie 0,14 proc. deepfake'ów przeszło przez to pierwsze sito niezauważonych.

Film najpierw zamienia się we wzór dla światła

Za projektem stoją Parnian Ghapandar Kashani, Shiqi Chen i Aydogan Ozcan z UCLA. To jednak nie urządzenie, które wystarczy przyłożyć do ekranu - pierwszy etap wciąż przebiega cyfrowo. Z każdego nagrania wybiera się 12 klatek, lokalizuje na nich twarz, a niewielkie sieci neuronowe badają obraz zarówno w standardowej przestrzeni, jak i w dziedzinie częstotliwości. Wyodrębnione w ten sposób cechy zostają przekształcone w specjalny wzór fazowy - i tu zaczyna się najbardziej nietypowy fragment procesu.

Wzór trafia na przestrzenny modulator światła, który zmienia fazę przepuszczanej przez niego wiązki. Światło, rozchodząc się dalej przez układ, dzięki dyfrakcji samo realizuje część obliczeń potrzebnych do klasyfikacji. Na końcu fotodetektory odczytują intensywność sygnału w dwóch obszarach odpowiadających każdemu nagraniu - przewaga jednego z nich wskazuje na fałszywkę, drugiego na materiał autentyczny. Nie trzeba więc cyfrowo liczyć każdej kolejnej warstwy sieci, bo część matematyki wykonują prawa fizyki.

Największym atutem tego podejścia nie jest nawet sama skuteczność, ale sposób skalowania rozwiązania. W demonstracji naukowcy zakodowali jednocześnie 15 niezależnych filmów na jednym modulatorze, a wszystkie zostały przeanalizowane w ramach jednego przejścia światła przez układ.

Przy 15 równoległych strumieniach dokładność osiągnęła 97,79 proc., czułość 99,86 proc., a trafne rozpoznawanie materiałów autentycznych - 95,72 proc. Gdy badacze zwiększyli liczbę filmów w jednym układzie do 18, dokładność spadła do 96,13 proc., głównie z powodu zakłóceń między coraz gęściej upakowanymi kanałami optycznymi.

Zespół szacuje jednak, że nowoczesny modulator o rozdzielczości rzędu 10 megapikseli mógłby obsłużyć nawet około 120 filmów naraz. W takim praktycznym systemie głównym czynnikiem ograniczającym nie byłaby już sama optyka, lecz wstępny, cyfrowy etap przygotowania materiału do analizy.

Nawet Veo 3 nie przeszło niezauważone

Celeb-DF to powszechnie znany zbiór deepfake'ów, opierających się głównie na podmianie twarzy - dla dzisiejszych generatorów to przeciwnik raczej niewymagający. Z tego powodu naukowcy przygotowali dodatkowy test, tworząc własny zestaw nagrań wygenerowanych przy użyciu modelu Veo 3 od Google'a. To istotna różnica, bo Veo 3 buduje całe nagranie od zera, a nie nakłada twarzy na istniejący materiał - wiele typowych artefaktów montażu czy face swapu w ogóle się tu nie pojawia.

System wymagał dodatkowego dostrojenia, choć niewielkiego - do tego celu wykorzystano jedynie 50 filmów z Veo 3, co stanowiło mniej niż 1 proc. danych użytych w pierwotnym treningu modelu. Po tej korekcie detektor osiągnął w fizycznym eksperymencie 94,8 proc. dokładności oraz 97,61 proc. czułości. To wciąż nie czyni go uniwersalnym narzędziem do wykrywania wszystkich materiałów generowanych przez AI, ale potwierdza, że system nie bazuje jedynie na rozpoznawaniu charakterystycznych błędów starszych generatorów.

Światło ma jeszcze jedną przewagę: prawie nie zużywa energii na liczenie

Klasyczne detektory działające na GPU wykonują ogromną liczbę operacji dla każdego analizowanego materiału. Przy jednym filmie to żaden problem, ale w skali milionów nagrań wrzucanych codziennie do serwisów społecznościowych koszty energetyczne robią się znaczące.

W optycznym dekoderze, po ustawieniu odpowiedniego wzoru, kluczowa operacja zachodzi już podczas samego rozchodzenia się światła. Zespół oszacował, że zużycie energii na tym etapie wynosi od 1,38 do 4,11 mJ na film przy 15 równoległych kanałach.

Porównywalny pod względem skuteczności cyfrowy dekoder zużywał około 30,44 mJ. Przy tej samej przepustowości sam etap optyczny mógł więc potrzebować od 86,5 do 95,5 proc. mniej energii. Cały system wciąż ma jednak cyfrowy początek, więc rzeczywista oszczędność - liczona od gniazdka do finalnego wyniku - jest mniejsza. Autorzy jasno zaznaczają, że chodzi o rozwiązanie hybrydowe, a nie o komputer całkowicie pozbawiony elektroniki.

Wynik na poziomie prawie 98 proc. dotyczy konkretnego zbioru Celeb-DF i określonej konfiguracji laboratoryjnej. Na trudniejszym materiale rezultaty były niższe, choć dodanie dwóch pasywnych warstw dyfrakcyjnych pozwalało podnieść skuteczność bez konieczności wprowadzania kolejnego aktywnego procesora.

Autorzy nie sugerują więc, że na podstawie jednego sygnału z ich systemu należałoby automatycznie usuwać nagrania z internetu. System ma działać jako bardzo szybkie pierwsze sito - przepuścić ogromny strumień materiałów, odsiać oczywiste przypadki i skierować podejrzane nagrania do dalszej, bardziej szczegółowej analizy.

To interesujący kierunek badań również dlatego, że obecne detektory treści generowanych przez AI wciąż bywają zawodne. Im bardziej dopracowane stają się generatory, tym mniej sensu ma poszukiwanie jednego charakterystycznego artefaktu. Naukowcy z UCLA próbują więc zmienić same zasady tej rywalizacji - zamiast rozbudowywać sieć neuronową i zasilać ją coraz mocniejszą kartą graficzną, część pracy oddają fizyce.

Źródło: Spider's Web