Badacz Håkon Måløy odkrył nową metodę ataku typu prompt injection, która wykorzystuje funkcje Copilot w Microsoft Word. Atak polega na umieszczeniu w dokumencie ukrytych instrukcji, które sztuczna inteligencja interpretuje jako polecenia użytkownika. W efekcie Copilot może manipulować treścią dokumentu i – co kluczowe – kopiować te złośliwe instrukcje do nowo tworzonych plików.
Powstaje w ten sposób mechanizm samoreplikacji, gdzie każdy nowo wygenerowany dokument staje się kolejnym nośnikiem ataku. Proces ten może trwać nawet wtedy, gdy oryginalny, zainfekowany plik nie jest już dostępny w systemie. Mechanizm ten przypomina działanie klasycznych robaków komputerowych, ale operuje na poziomie logiki modelu językowego.
Problem został zgłoszony firmie Microsoft w ramach odpowiedzialnego ujawnienia. Mimo upływu 144 dni od zgłoszenia, obecnie nie istnieje skuteczne rozwiązanie, które chroniłoby przed całą klasą tego typu ataków. Sytuacja ta pokazuje nowe wyzwanie w zabezpieczaniu systemów opartych na LLM, gdzie złośliwe instrukcje mogą przenosić się między dokumentami poprzez interakcję z asystentem AI.

