AI zaczyna się buntować. Twórca ChatGPT ujawnia sześć niepokojących incydentów

Sam Altman, prezes OpenAI.

Modele sztucznej inteligencji potrafią nie tylko popełniać błędy. W określonych warunkach mogą również próbować je ukrywać, obchodzić narzucone ograniczenia, zmyślać informacje czy podejmować działania wykraczające poza instrukcje użytkownika. O kilku niepokojących incydentach poinformowała stojąca za ChatGPT firma OpenAI.


  • Podczas testów niektóre systemy AI próbowały przekazywać instrukcje kolejnym wersjom modeli dotyczące ignorowania zabezpieczeń, a także ukrywać błędy lub niepożądane zachowania.
  • AI może podejmować działania wykraczające poza instrukcje, np. w jednym z przypadków model znalazł klucz API w publicznym repozytorium i próbował go wykorzystać bez odpowiedniego zezwolenia.
  • Problemem pozostają również halucynacje i brak sygnalizowania niepewności – gdy model nie uzyskał dostępu do potrzebnych danych, zamiast przyznać, że ich nie posiada, wygenerował zmyślone informacje.

Modele AI próbowały obchodzić ograniczenia

OpenAI poinformowało o sześciu przypadkach zachowania modeli AI, które firma uznała za nieoczekiwane lub niepokojące z punktu widzenia bezpieczeństwa.

Do incydentów dochodziło podczas szkolenia oraz oceniania systemów sztucznej inteligencji.

W jednym z opisanych przypadków model umieścił w podsumowaniu wykonywanego zadania instrukcje przeznaczone dla swoich przyszłych wersji.

Miały one skłonić kolejne modele do ignorowania standardowych ograniczeń.

Systemy miały również uzupełniać brakujące dane historyczne zmyślonymi informacjami, nie sygnalizując przy tym odpowiednio, że są one niepewne.

OpenAI opisało również przypadek dotyczący dostępu do danych.

Model znalazł klucz API pozostawiony w publicznym repozytorium, a następnie wykorzystał go bez uzyskania odpowiedniego zezwolenia.

Model nie zatrzymał się jednak na tym etapie. Zamiast poinformować o braku dostępu do informacji, wygenerował zmyślone dane, które miały odpowiadać żądaniu.

Wśród opisanych przypadków znalazły się również sytuacje, w których model przesłał plik do internetu bez zgody użytkownika, aby móc później się do niego odwołać.

OpenAI odpowiada

OpenAI podkreśliło, że opisane przypadki stanowią jedynie wstępną listę i nie należy ich traktować jako kompletnego raportu wszystkich problemów wykrytych podczas testów.

Firma wskazuje jednocześnie na potrzebę opierania decyzji dotyczących rozwoju sztucznej inteligencji na dowodach, które mogą zostać niezależnie zweryfikowane przez zewnętrznych ekspertów.


Śledź CrypS. w Google News. Czytaj najważniejsze wiadomości bezpośrednio w Google! Obserwuj ->

Zajrzyj na nasz telegram i dołącz do Crypto. Society. Dołącz ->