Twórcy ChataGPT opublikowali raport, za którego pośrednictwem poinformowano o tymczasowym spowolnieniu rozwoju przełomowych modeli sztucznej inteligencji, w tym tego znanego jako Astra. Wstępne analizy wykazały, że Astra przekroczyła krytyczny próg możliwości w obszarze cyberbezpieczeństwa, co zmusiło przedsiębiorstwo do podjęcia zdecydowanych kroków i ponownego przeanalizowania dotychczasowych poczynań. W reakcji na potencjalne zagrożenia oraz niedawny atak na Hugging Face, podjęto decyzję o wstrzymaniu kluczowych procesów treningowych, zaostrzeniu procedur izolacji środowisk badawczych oraz wdrożeniu kosztownego systemu monitorowania pracy algorytmów.
OpenAI zwalnia tempo
Jak napisano w omawianym dokumencie, ostatnie tygodnie przyniosły garść istotnych wniosków dotyczących rozwoju nowej generacji modeli sztucznej inteligencji. Zgodnie z założeniami programu Preparedness Framework, wstępne ewaluacje modelu Astra wykazały, że może on osiągać poziom określany jako krytyczny w zakresie zdolności z kategorii cyberbezpieczeństwa. W połączeniu z tym, czego OpenAI dowiedziało się po incydencie z udziałem Hugging Face, odkrycie to wymusiło natychmiastowe zaostrzenie procedur bezpieczeństwa.
W celu dostosowania standardów do rosnącego ryzyka podjęto konkretne kroki. Zdecydowano się na dwutygodniową pauzę treningów metodą uczenia ze wzmocnieniem (RL, ang. reinforced learning) dla najnowszych modeli przeznaczonych do wdrożenia, z kolei największa zaplanowana sesja RL została całkowicie wstrzymana. OpenAI ma zamiar wykorzystać zyskany czas na przeprowadzenie szkoleń i procesu ewaluacji na mniejszą skalę celem oceny zachowania modelu. Firma zobligowała się również do zweryfikowania swoich zabezpieczeń i zebrania większej liczby dowodów dotyczących zgodności technologii z wewnętrznymi zasadami.
Rygorystyczna izolacja środowisk badawczych
Zwiększone możliwości modeli w zakresie generowania i wykonywania kodu wymusiły wprowadzenie istotnych zmian w architekturze wewnętrznej. Wstrzymano uruchamianie wnioskowania dla obciążeń badawczych mogących wykonywać kod lub łączyć się z siecią zewnętrzną.
Wdrożone zabezpieczenia obejmują:
- Izolację obciążeń: Wprowadzono bezwzględny wymóg uruchamiania kodu generowanego przez model w odizolowanych środowiskach, tzw. piaskownicach (lub „sandboksach”, jeśli ktoś woli angielską terminologię);
- Ochronę sieciową: Zastosowano mechanizmy uniemożliwiające przejęcie nieautoryzowanego dostępu do internetu w przypadku naruszenia pojedynczej usługi;
- Automatyczne testy penetracyjne: Zredukowano stałe uprawnienia oraz wdrożono modele AI do ciągłego testowania barier zabezpieczających przed symulowanymi atakami.
Jak oświadczyło OpenAI:
Obecnie wymagamy zastosowania najsurowszych środków bezpieczeństwa w odniesieniu do obciążeń związanych z modelami Astra lub modelami cybernetycznymi, ponieważ ustaliliśmy, że modele Astra mogą posiadać krytyczny poziom zdolności cyberbezpieczeństwa. Środki te mają również zastosowanie do wszystkich innych obciążeń związanych z cyberbezpieczeństwem. Chociaż niektóre procesy szkolenia i oceny modeli Astra spełniają te wymagania, znaczna liczba obciążeń pozostaje wstrzymana do czasu ich pełnej migracji i ulepszenia w celu spełnienia nowych standardów bezpieczeństwa. Priorytetowo traktujemy zadania związane z bezpieczeństwem i dostosowaniem, które jako pierwsze zostaną przeniesione do tych nowych środowisk.
OpenAI
Sam Altman i spółka nie wierzą własnym tworom
Nowo wprowadzony system nadzoru analizuje wewnętrzną pracę modelu przy każdym tokenie za pomocą klasyfikatorów aktywacji. W przypadku wykrycia podejrzanych działań, takich jak próby kradzieży danych, oszukiwania zabezpieczeń czy nieautoryzowanego dostępu, o zajściu automatycznie dowiaduje się stosowny zespół.
W przypadku, gdy system zidentyfikuje ryzyko naruszenia barier bezpieczeństwa, wysyła powiadomienie o najwyższym priorytecie. Zespoły badawcze mają 30 minut na wykluczenie błędu, w przeciwnym razie proces jest automatycznie wstrzymywany. Jak podkreślono, koszt utrzymania tego nadzoru jest ogromny i pochłania około 20% całej mocy obliczeniowej przeznaczonej na wnioskowanie.
OpenAI zapowiedziało dalszą ewolucję swojego programu Preparedness Framework i zapewnia, iż przedkłada bezpieczeństwo nad tempo wdrażania nowych rozwiązań.











0 komentarzy