Przejdź do treści

OpenAI spowalnia rozwój swojej AI ze względu na obawy co do bezpieczeństwa. „Nasze standardy w zakresie monitorowania, dostosowywania i bezpieczeństwa muszą wyprzedzać zagrożenia”

3 minuty czytania

Wygląda na to, że OpenAI postanowiło wyciągnąć wnioski z ostatniego incydentu z udziałem swojej technologii i platformy Hugging Face.

Twórcy ChataGPT opublikowali raport, za którego pośrednictwem poinformowano o tymczasowym spowolnieniu rozwoju przełomowych modeli sztucznej inteligencji, w tym tego znanego jako Astra. Wstępne analizy wykazały, że Astra przekroczyła krytyczny próg możliwości w obszarze cyberbezpieczeństwa, co zmusiło przedsiębiorstwo do podjęcia zdecydowanych kroków i ponownego przeanalizowania dotychczasowych poczynań. W reakcji na potencjalne zagrożenia oraz niedawny atak na Hugging Face, podjęto decyzję o wstrzymaniu kluczowych procesów treningowych, zaostrzeniu procedur izolacji środowisk badawczych oraz wdrożeniu kosztownego systemu monitorowania pracy algorytmów.

OpenAI zwalnia tempo

Jak napisano w omawianym dokumencie, ostatnie tygodnie przyniosły garść istotnych wniosków dotyczących rozwoju nowej generacji modeli sztucznej inteligencji. Zgodnie z założeniami programu Preparedness Framework, wstępne ewaluacje modelu Astra wykazały, że może on osiągać poziom określany jako krytyczny w zakresie zdolności z kategorii cyberbezpieczeństwa. W połączeniu z tym, czego OpenAI dowiedziało się po incydencie z udziałem Hugging Face, odkrycie to wymusiło natychmiastowe zaostrzenie procedur bezpieczeństwa.

W celu dostosowania standardów do rosnącego ryzyka podjęto konkretne kroki. Zdecydowano się na dwutygodniową pauzę treningów metodą uczenia ze wzmocnieniem (RL, ang. reinforced learning) dla najnowszych modeli przeznaczonych do wdrożenia, z kolei największa zaplanowana sesja RL została całkowicie wstrzymana. OpenAI ma zamiar wykorzystać zyskany czas na przeprowadzenie szkoleń i procesu ewaluacji na mniejszą skalę celem oceny zachowania modelu. Firma zobligowała się również do zweryfikowania swoich zabezpieczeń i zebrania większej liczby dowodów dotyczących zgodności technologii z wewnętrznymi zasadami.

Rygorystyczna izolacja środowisk badawczych

Zwiększone możliwości modeli w zakresie generowania i wykonywania kodu wymusiły wprowadzenie istotnych zmian w architekturze wewnętrznej. Wstrzymano uruchamianie wnioskowania dla obciążeń badawczych mogących wykonywać kod lub łączyć się z siecią zewnętrzną.

Wdrożone zabezpieczenia obejmują:

  • Izolację obciążeń: Wprowadzono bezwzględny wymóg uruchamiania kodu generowanego przez model w odizolowanych środowiskach, tzw. piaskownicach (lub „sandboksach”, jeśli ktoś woli angielską terminologię);
  • Ochronę sieciową: Zastosowano mechanizmy uniemożliwiające przejęcie nieautoryzowanego dostępu do internetu w przypadku naruszenia pojedynczej usługi;
  • Automatyczne testy penetracyjne: Zredukowano stałe uprawnienia oraz wdrożono modele AI do ciągłego testowania barier zabezpieczających przed symulowanymi atakami.

Jak oświadczyło OpenAI:

Obecnie wymagamy zastosowania najsurowszych środków bezpieczeństwa w odniesieniu do obciążeń związanych z modelami Astra lub modelami cybernetycznymi, ponieważ ustaliliśmy, że modele Astra mogą posiadać krytyczny poziom zdolności cyberbezpieczeństwa. Środki te mają również zastosowanie do wszystkich innych obciążeń związanych z cyberbezpieczeństwem. Chociaż niektóre procesy szkolenia i oceny modeli Astra spełniają te wymagania, znaczna liczba obciążeń pozostaje wstrzymana do czasu ich pełnej migracji i ulepszenia w celu spełnienia nowych standardów bezpieczeństwa. Priorytetowo traktujemy zadania związane z bezpieczeństwem i dostosowaniem, które jako pierwsze zostaną przeniesione do tych nowych środowisk.

OpenAI

Sam Altman i spółka nie wierzą własnym tworom

Nowo wprowadzony system nadzoru analizuje wewnętrzną pracę modelu przy każdym tokenie za pomocą klasyfikatorów aktywacji. W przypadku wykrycia podejrzanych działań, takich jak próby kradzieży danych, oszukiwania zabezpieczeń czy nieautoryzowanego dostępu, o zajściu automatycznie dowiaduje się stosowny zespół.

W przypadku, gdy system zidentyfikuje ryzyko naruszenia barier bezpieczeństwa, wysyła powiadomienie o najwyższym priorytecie. Zespoły badawcze mają 30 minut na wykluczenie błędu, w przeciwnym razie proces jest automatycznie wstrzymywany. Jak podkreślono, koszt utrzymania tego nadzoru jest ogromny i pochłania około 20% całej mocy obliczeniowej przeznaczonej na wnioskowanie.

OpenAI zapowiedziało dalszą ewolucję swojego programu Preparedness Framework i zapewnia, iż przedkłada bezpieczeństwo nad tempo wdrażania nowych rozwiązań.

0 komentarzy

Zostaw komentarz