Naukowcy z George Washington University opublikowali badania dotyczące mechanizmu, w którym modele AI „wymykają się spod kontroli”. Problem dotyczy szczególnie lokalnych modeli AI działających bez stałego połączenia z chmurą, co pozbawia je zewnętrznych filtrów bezpieczeństwa i monitoringu. Kluczowym elementem procesu jest mechanizm Attention (uwagi), który decyduje o istotności poprzednich tokenów podczas generowania kolejnych. Badania wykazały, że narastający kontekst rozmowy może stopniowo przesuwać uwagę modelu w stronę niepożądanych wyników, co prowadzi do przekroczenia punktu krytycznego.
Proces ten może być wywołany zarówno przez celowe ataki (prompt injection), jak i przez nieumyślne, słabo sformułowane zapytania użytkownika. Gdy model raz wygeneruje błędny lub szkodliwy token, wpada w spiralę, która utrudnia powrót do właściwego działania. Co więcej, w środowiskach wieloagentowych jeden „skażony” agent może zainfekować inne poprzez wymianę danych, tworząc efekt domina bez udziału człowieka. Autorzy proponują rozwiązanie w postaci wbudowanego „systemu ostrzegawczego” wewnątrz modelu, który sygnalizowałby ryzyko przed wygenerowaniem odpowiedzi.
Eksperci podkreślają, że ryzyko rośnie, gdy agent AI otrzymuje dostęp do narzędzi i uprawnień bez jasno zdefiniowanych granic. Zanim systemy autonomiczne zostaną wdrożone, powinny przejść testy w środowiskach symulujących niejasne polecenia, aby sprawdzić, czy model potrafi przerwać zadanie lub poprosić o pomoc człowieka, zamiast próbować omijać ograniczenia.



