Branża

Anthropic alarmuje: chińskie firmy na masową skalę próbują wyciągać wiedzę z modeli Claude

Anthropic ujawnił pięć kampanii typu distributed, w ramach których napastnicy wygenerowali blisko 200 mln interakcji z Claude, próbując wykradać schematy jego rozumowania do trenowania własnych systemów AI.

3 min czytania

Anthropic poinformował o wykryciu pięciu odrębnych kampanii opartych na atakach typu distributed, których celem było wyciąganie wiedzy zgromadzonej w modelach Claude. Na przestrzeni kilku miesięcy napastnicy doprowadzili do prawie 200 mln interakcji z systemem, starając się przede wszystkim uchwycić mechanizmy rozumowania modelu, by wykorzystać je później do szkolenia konkurencyjnych rozwiązań AI.

Chińskie firmy próbują wykradać możliwości modeli Claude. Anthropic ujawnia skalę ataków
Źródło: Anthropic

Według firmy natężenie i śmiałość takich prób znacząco przybrały na sile w ostatnich miesiącach, co ma bezpośredni związek z zaostrzającą się rywalizacją na rynku sztucznej inteligencji. W opublikowanym raporcie Anthropic zwraca uwagę na rosnącą pomysłowość podmiotów działających bez autoryzacji.

W ciągu ostatnich kilku miesięcy nieautoryzowane laboratoria opracowały coraz bardziej wyrafinowane metody omijania naszych zabezpieczeń i wykorzystywania potencjału amerykańskich modeli granicznych

raport Anthropic

Ataki na sposób rozumowania modeli

Napastnicy skupiają się na wydobyciu treści generowanych przez model w trakcie realizacji zadań – w tym śladów jego procesu myślowego. Zdobyte w ten sposób dane mogą posłużyć do trenowania mniejszych modeli, na przykład metodą nadzorowanego dostrajania.

Anthropic nie ujawnia użytkownikom pełnej, wewnętrznej reprezentacji rozumowania Claude'a – zamiast tego dostarcza jedynie skondensowane fragmenty podsumowujące tok myślenia modelu. Mimo to atakującym udało się znaleźć metody obchodzenia tego zabezpieczenia. W jednym z odnotowanych przypadków próbowano wymusić na modelu odtworzenie wcześniejszej pamięci roboczej, maskując to jako zwykłą prośbę o przetłumaczenie tekstu na język japoński.

Firma zaznacza, że wykryte kampanie nie ograniczały się jedynie do zdolności rozumowania. Napastnicy interesowali się także funkcjami agentowymi, obsługą narzędzi zewnętrznych, umiejętnościami programistycznymi oraz analizą danych.

3 mln wymian dziennie

Najbardziej rozbudowaną z ujawnionych kampanii Anthropic połączył z holdingiem technologiczno-handlowym Alibaba. Między majem a lipcem 2026 roku zarejestrowano 151 mln wymian ukierunkowanych na wydobycie danych z Claude'a. W momencie największej aktywności liczba wymian sięgała blisko 3 mln dziennie.

Operacja opierała się na około 3500 kontach, które na pierwszy rzut oka funkcjonowały niezależnie od siebie. Anthropic zdołał je jednak połączyć, identyfikując powtarzający się, charakterystyczny wzorzec zapytań służących wyciąganiu informacji o funkcjonowaniu modelu. Zdaniem specjalistów firmy, zebrane w ten sposób materiały mogły służyć jako dane szkoleniowe dla rodziny modeli Qwen, rozwijanej przez chiński koncern.

Moonshot AI masowo odpytywał Claude'a

Kolejny opisany przypadek dotyczy Moonshot AI, firmy stojącej za modelem Kimi. Eksperci Anthropic sugerują, że część skierowanych zapytań mogła wynikać z potrzeb powiązanych z chińskim wojskiem.

W jednym z badanych scenariuszy Claude był wykorzystywany do analizy nagrań z kamer monitoringu i miał wskazywać, czy uchwycona osoba "zachowuje się nienormalnie". W ciągu jedynie 10 dni do modelu trafiło niemal 300 tys. zapytań, rozłożonych na około 5 tys. kont, korzystających głównie z wersji Claude Opus.

Anthropic już wcześniej alarmował w sprawie podobnych działań – w lutym firma wskazała konkretne chińskie laboratoria zaangażowane w takie praktyki. Podobne sygnały płynęły też od OpenAI, które łączyło część tej aktywności m.in. z firmą DeepSeek. Najnowsze ustalenia dowodzą jednak, że skala i poziom zaawansowania stosowanych metod stale rośnie.

Źródło: ITwiz

Źródło: ITwiz