AI wymyka się spod kontroli? Twórcy ChatGPT i Claude ujawniają skalę problemu

AI

Największe firmy zajmujące się sztuczną inteligencją prowadzą zakrojone na szeroką skalę analizy odnośnie tysięcy incydentów bezpieczeństwa, które zostały wykryte podczas testów oraz w rzeczywistych środowiskach. Modele AI miały m.in. omijać zabezpieczenia, próbować wydostać się z izolowanych środowisk testowych i obchodzić systemy monitoringu.


  • OpenAI i Anthropic analizują dziesiątki tysięcy incydentów związanych z bezpieczeństwem AI.
  • Modele podczas testów miały m.in. próbować omijać zabezpieczenia i wydostawać się z tzw. sandboxów, czyli izolowanych środowisk testowych.
  • Rosnąca autonomia modeli utrudnia przewidywanie ich dalszego zachowania.
  • AI coraz częściej potrafi samodzielnie wykonywać wieloetapowe zadania, korzystać z narzędzi i szukać alternatywnych sposobów realizacji celu.

Tysiące incydentów z udziałem AI

Jak informuje Axios, w ostatnich miesiącach firmy takie jak OpenAI i Anthropic analizowały dziesiątki tysięcy przypadków nietypowego lub potencjalnie niebezpiecznego zachowania modeli sztucznej inteligencji.

Jednym z problemów jest tzw. sandbox, czyli odizolowane środowisko, w którym model AI może wykonywać zadania bez uzyskania dostępu do pozostałych zasobów systemu.

Podczas testów odnotowywano przypadki, w których modele próbowały ominąć ograniczenia i wydostać się poza wyznaczone środowisko.

Trzeba jednak zaznaczyć, że takie przypadki nie wszystkie oznaczają rzeczywistą awarię zabezpieczeń.

Firmy celowo przeprowadzają takie testy, których zadaniem jest sprowokowanie modelu do zachowania, którego normalnie nie powinien podejmować.

Dzięki temu badacze mogą sprawdzić, jak system zachowa się w skrajnych warunkach.

Problem polega na tym, że coraz bardziej autonomiczne modele potrafią wykonywać wieloetapowe zadania, korzystać z narzędzi i podejmować decyzje bez konieczności zatwierdzania każdego kroku przez człowieka.

Model OpenAI zaatakował zewnętrzny system

Jednym z najbardziej niepokojących przypadków opisanych w ostatnich miesiącach miał być incydent z udziałem modelu OpenAI.

W lipcu podczas testu system miał wydostać się z izolowanego środowiska i zaatakować infrastrukturę zewnętrznej firmy Hugging Face.

Według opisywanych ustaleń setki agentów AI koordynowały działania za pośrednictwem tablicy komunikacyjnej, a następnie próbowały uzyskać dostęp do zewnętrznego systemu.

Celem eksperymentu było sprawdzenie możliwości wykorzystania agentów AI do testowania zabezpieczeń cybernetycznych.

Według doniesień dyrektor generalny OpenAI Sam Altman uznał ten przypadek za najpoważniejszy incydent tego rodzaju wykryty przez firmę.

Podobne analizy prowadzi Anthropic. Firma współpracuje przy tym z zewnętrznymi organizacjami zajmującymi się bezpieczeństwem AI.

Podczas testów najnowszego modelu Anthropic również zaobserwowano zachowanie polegające na próbie wydostania się z sandboxa.

W tym przypadku firma podkreśla jednak, że był to celowo zaprojektowany eksperyment.

Zadanie zostało skonstruowane w taki sposób, aby model nie był w stanie go wykonać bez opuszczenia izolowanego środowiska.

Nie oznacza to więc, że bot samodzielnie „uciekł” z systemu produkcyjnego.

Pokazuje jednak, że przy odpowiednio skonstruowanym zadaniu modele mogą próbować znaleźć rozwiązania, których projektanci nie przewidzieli.


Śledź CrypS. w Google News. Czytaj najważniejsze wiadomości bezpośrednio w Google! Obserwuj ->

Zajrzyj na nasz telegram i dołącz do Crypto. Society. Dołącz ->