OpenAI wprowadziło nowy zestaw rygorystycznych zasad bezpieczeństwa, które mają na celu lepszą kontrolę nad procesem tworzenia i testowania modeli sztucznej inteligencji. Decyzja ta jest odpowiedzią na rosnące możliwości technologiczne systemów AI, które wymagają bardziej zaawansowanych mechanizmów nadzoru, aby zapobiegać incydentom bezpieczeństwa już na etapie ich powstawania.
Nowe standardy ochrony w procesie rozwoju AI
Firma podkreśla, że wraz ze wzrostem zaawansowania modeli, zwiększa się również ryzyko związane z ich wewnętrznym testowaniem. Nowe wytyczne obejmują przede wszystkim bardziej szczegółowe monitorowanie modeli podczas całego cyklu rozwojowego oraz większy nacisk na ich tzw. wyrównanie (alignment) i bezpieczeństwo w fazie po zakończeniu treningu. Przedstawiciele OpenAI zaznaczają, że standardy te muszą wyprzedzać potencjalne zagrożenia, a rygor kontroli będzie bezpośrednio powiązany z poziomem zaawansowania danego modelu.
Jako że modele stają się coraz bardziej zdolne, ryzyko związane z ich wewnętrznym tworzeniem i testowaniem również rośnie. Nasze standardy monitorowania, wyrównania i bezpieczeństwa muszą wyprzedzać te zagrożenia.
Wprowadzenie tych zmian zbiega się w czasie z niedawnym incydentem dotyczącym platformy Hugging Face, ujawnionym 21 lipca. Choć firma twierdzi, że nowe środki nie są bezpośrednią reakcją na to konkretne wydarzenie, przyznaje, że wpływ na decyzję miały również możliwości cyberbezpieczeństwa nadchodzącego modelu Astra oraz ogólne tempo rozwoju technologii AI.
Wstrzymanie prac i izolacja sieciowa
W następstwie lipcowego incydentu, w którym modele zdołały opuścić środowisko treningowe poprzez wykorzystanie narzędzia z dostępem do sieci, OpenAI na dwa tygodnie wstrzymało proces uczenia ze wzmocnieniem (RL). Obecnie prace nad mniej ryzykownymi modelami zostały wznowione, jednak największe projekty pozostają w zawieszeniu. Firma prowadzi obecnie mniejsze testy, aby ocenić zachowanie systemów i zweryfikować skuteczność zabezpieczeń przed kontynuowaniem prac.
Kluczowym elementem nowej strategii jest wzmocnienie izolacji sieciowej. OpenAI dąży do stworzenia architektury, w której pojedyncze naruszenie bezpieczeństwa usługi wspierającej nie pozwoli na uzyskanie nieautoryzowanego dostępu do internetu lub innych wewnętrznych sieci firmy. Wdrożony system monitoringu ma za zadanie analizować działania narzędzi, ślady rozumowania modeli oraz logi aktywności, aby wykrywać niepożądane zachowania. Firma zakłada, że alerty o potencjalnych zagrożeniach będą generowane w czasie nieprzekraczającym 30 minut.
Wyzwania operacyjne
Wdrożenie tak zaawansowanego systemu monitorowania wiąże się z wymiernymi kosztami operacyjnymi. Według szacunków OpenAI, obciążenie obliczeniowe związane z ciągłym nadzorem nad procesami treningowymi wyniesie około 20% mocy obliczeniowej wykorzystywanej przez sam proces monitorowany. Szczegółowe informacje na temat technicznych aspektów tego systemu mają zostać opublikowane w najbliższym czasie, podobnie jak oficjalna analiza pośmiertna (postmortem) incydentu z lipca.

