Google pokazuje Gemini 4 Argon - nowy model ma być najmocniejszy w historii firmy
Po wstrzymaniu prac nad Gemini 3.5 Pro i skupieniu się na tańszym wariancie Flash, Google wraca z zupełnie nową architekturą. Gemini 4 Argon ma miliony tokenów kontekstu, poprawiać bezpieczeństwo kodu i pokonywać konkurencję w testach.
Google przez dłuższy czas udostępniało swoją sztuczną inteligencję głównie w lekkiej odmianie Flash - tak było w przypadku Gemini 3.5 oraz Gemini 3.8. Bardziej ambitny projekt, Gemini 3.5 Pro, trafił do kosza jeszcze przed publikacją.
Powodem był nacisk na redukcję wydatków związanych z infrastrukturą serwerową. W efekcie rozwój mocniejszej linii Pro stał w miejscu, a osoby liczące na wyraźny postęp jakościowy musiały zadowolić się szybszymi, ale uboższymi funkcjonalnie wariantami.
Tak doszło do sytuacji, w której najnowszym reprezentantem serii Pro na dłuższy czas został Gemini 3.1 Pro - model, który z miesiąca na miesiąc radził sobie coraz słabiej na tle rywali. W Google doszli do wniosku, że dłuższe łatanie wiekowej technologii nie przynosi efektów, więc zrezygnowano z pośredniego etapu rozwoju i postawiono na budowę architektury całkowicie od podstaw.
Gemini 4 Argon i jego możliwości - prawie bez ograniczeń
Nowy model, Gemini 4 Argon, zaprojektowano z myślą o programowaniu, tworzeniu treści pisanych oraz analityce danych. Twórcy szczególną uwagę poświęcili kwestiom bezpieczeństwa - system ma zdolność samodzielnego wykrywania błędów w kodzie, ich weryfikacji oraz automatycznego usuwania.
Według benchmarków przygotowanych przez samo Google, Argon wypada lepiej niż rywale tej klasy, w tym Claude Opus 5.5 i GPT-6 Astra. Najbardziej rzuca się w oczy jednak inna zmiana - limit długości generowanej odpowiedzi skoczył z 64 tysięcy do miliona tokenów.
W pierwszej fazie dostęp do Argona otrzymali wybrani partnerzy biznesowi oraz wewnętrzne zespoły giganta z Mountain View. Model znalazł zastosowanie choćby w optymalizacji wykorzystania pamięci w centrach danych - dzięki niemu udało się odzyskać ponad 300 TiB przestrzeni (tebibajt, czyli TB powiększony o około 10 proc.).
Drugim obszarem testów była migracja starego kodu napisanego w C i C++ do bezpieczniejszego i bardziej współczesnego języka Rust. Gemini 4 Argon przetwarza całe zbiory plików naraz i tworzy bezpieczny kod, który w testach działa wydajniej niż rozwiązania generowane przez tradycyjne, zautomatyzowane konwertery.
Nadzór nad tokiem rozumowania i mechanizmy ochronne
Zanim model trafił do szerszego użytku, zastosowano wobec niego szczegółowe zabezpieczenia. Mają one zapobiegać wykorzystaniu Argona do szkodliwych działań, na przykład ataków cybernetycznych lub chemicznych, a także chronić przed próbami manipulacji poprzez podsuwanie mu szkodliwych instrukcji.
Działanie modelu jest na bieżąco monitorowane przez dedykowane systemy śledzące jego tok rozumowania.
Gdy system wykryje próbę obejścia ustalonych reguł, generowana odpowiedź zostaje natychmiast przerwana. Dane dotyczące takich incydentów nie są wykorzystywane w dalszym treningu modelu - ma to zapobiec sytuacji, w której w przyszłości nauczyłby się skrywać podobne zachowania lepiej niż dotychczas.
Dostęp do Gemini 4 Argon zapewni płatny abonament Google AI Ultra, a także API przeznaczone dla firm i deweloperów. Początkowe stawki to 2 dolary za milion tokenów wejściowych oraz 10 dolarów za milion tokenów wyjściowych, przy czym zapamiętany kontekst jest rozliczany ze znaczną zniżką. Po zakończeniu okresu promocyjnego opłaty mają wzrosnąć. Wszystko to sugeruje, że model kierowany jest przede wszystkim do zastosowań profesjonalnych.
Co z tego ma przeciętny użytkownik?
Osoby korzystające z bezpłatnej wersji Gemini na razie nie zauważą żadnej różnicy po wprowadzeniu nowego modelu.
Proste, codzienne czynności, jak redagowanie wiadomości e-mail czy skracanie tekstów, nadal będą obsługiwane przez tańsze i szybsze modele z rodziny Flash. Pełną moc Argona Google zarezerwowało dla klientów korporacyjnych oraz posiadaczy najdroższego planu Ultra.
Abonenci płatnych pakietów otrzymają jednak naprawdę szerokie możliwości. Znacznie wyższy limit długości odpowiedzi oznacza, że model nie przerywa generowania tekstu w połowie zadania.
To otwiera drogę do jednorazowej analizy ogromnych zbiorów danych - na przykład całych projektów programistycznych, długich materiałów wideo czy rozbudowanych raportów.
Pozostali użytkownicy poczują zmiany w sposób bardziej pośredni - poprzez większą stabilność i bezpieczeństwo aplikacji, z których korzystają. Przeniesienie kluczowych usług na bezpieczniejszy język programowania oraz automatyczne wykrywanie i naprawa błędów powinny ograniczyć ryzyko awarii oraz atakom hakerskim na smartfonach i w przeglądarkach internetowych. Przynajmniej w teorii.
Źródło: Spider's Web


