Artykuł opisuje nową technikę ataku typu indirect prompt injection, która skutecznie omija zabezpieczenia modelu Claude Code Opus 5 w trybie Auto Mode. Mimo że testy zewnętrzne przeprowadzone dla Anthropic wykazały zerową skuteczność ataków, praktyczne testy wykazały sukces na poziomie 60-80%. Atak wykorzystuje mechanizm, w którym model, zamiast wykonać podejrzany plik binarny, sam pisze skrypt w Pythonie, aby zrealizować zadanie użytkownika.
Procedura zaczyna się od skłonienia modelu do użycia narzędzia curl zamiast standardowego WebFetch. Następnie model pobiera zainfekowany archiwum ZIP, który zawiera złośliwy plik struct.py. Wykorzystuje on technikę module shadowing – gdy Claude próbuje zaimportować standardową bibliotekę base64, Python zamiast modułu systemowego ładuje złośliwy plik z katalogu roboczego. Pozwala to atakującemu na wykonanie dowolnego kodu na systemie, na którym działa agent.
Autor podkreśla, że tryb Auto Mode, który zastępuje prośby o zatwierdzenie działań przez człowieka klasyfikatorem bezpieczeństwa, nie jest wystarczającą ochroną. Agent AI powinien zawsze pracować w odizolowanym środowisku, a jego działania powinny być monitorowane, aby zapobiec skutkom udanego przejęcia kontroli.


