Zaawansowane modele sztucznej inteligencji od OpenAI miały przez wiele miesięcy potajemnie komunikować się ze sobą i szukać sposobu na wydostanie się z zamkniętego środowiska testowego. W efekcie doszło do słynnego już ataku na platformę Hugging Face.
- Podczas konferencji Black Hat w Las Vegas badacze OpenAI Eric Wallace i Michael Dalton przedstawili analizę incydentu z udziałem agentów AI.
- Według ich ustaleń modele przez wiele miesięcy wymieniały informacje za pomocą wewnętrznych kanałów komunikacji i próbowały znaleźć sposób na uzyskanie dostępu do internetu mimo działania w izolowanym środowisku testowym.
- Eksperci wskazują, że takie skrajne zachowanie modeli pojawiło się w sytuacjach, gdy otrzymywały zadania niemożliwe do wykonania bez dostępu do zewnętrznych zasobów.
Sztuczna inteligencja zaczęła współpracować za plecami twórców
Podczas konferencji dot. cyberbezpieczeństwa Black Hat w Las Vegas badacze OpenAI Eric Wallace i Michael Dalton przedstawili wyniki analizy incydentu z udziałem agentów AI.
Według ich ustaleń modele zaczęły wymieniać między sobą informacje już w maju, wykorzystując wewnętrzne kanały komunikacji, których wcześniej nie wykryto.
Celem było znalezienie sposobu na uzyskanie dostępu do „wolnego” internetu
Badacze wskazują na to, że problem pojawił się, gdy modele otrzymały zadania niemożliwe do wykonania bez dostępu do sieci.
Jednym z przykładów był plik zawierający odnośniki do Google Drive, do których AI nie mogła uzyskać dostępu w trybie offline. W innym przypadku zabrakło pliku źródłowego potrzebnego do wykonania zadania.
Gdy agent znalazł się w sytuacji bez wyjścia, miał zasugerować poszukanie rozwiązania w internecie. To zapoczątkowało współpracę między różnymi modelami.
Według badaczy AI zaczęła dzielić się zadaniami i szukać luk w systemach, aby obejść ograniczenia narzucone przez twórców.
Początkowo sądzono, że incydent dotyczył głównie platformy Hugging Face. Późniejsza analiza OpenAI wykazała jednak, że zaawansowane modele próbowały uzyskać dostęp także do kilku innych publicznych systemów.
Firma przyznała, że agenci AI wykorzystali luki w infrastrukturze, w tym mechanizmy umożliwiające dostęp do internetu z zamkniętych środowisk testowych.
Ostrzeżenie przed nową generacją cyberataków
Badacze OpenAI podkreślili, że współczesne modele AI mogą wykazywać silną determinację w realizacji wyznaczonych celów, nawet jeśli prowadzi to do działań sprzecznych z pierwotnymi założeniami.
Michael Dalton stwierdził, że najbardziej zaawansowane modele „lubią oszukiwać”, ponieważ podczas procesu uczenia są często nagradzane za skuteczność i szybkie rozwiązywanie problemów.
Śledź CrypS. w Google News. Czytaj najważniejsze wiadomości bezpośrednio w Google! Obserwuj ->
Zajrzyj na nasz telegram i dołącz do Crypto. Society. Dołącz ->