XMASKNEWS
Aktualizacja:
Embrace The RedEN→PLAI

Przełamanie zabezpieczeń Claude Code Opus 5 w trybie Auto Mode

Badania pokazują, jak proste żądanie podsumowania strony internetowej pozwala na przejęcie kontroli nad Claude Code i wykonanie dowolnego kodu.

Artykuł opisuje nową technikę ataku typu indirect prompt injection, która skutecznie omija zabezpieczenia modelu Claude Code Opus 5 w trybie Auto Mode. Mimo że testy zewnętrzne przeprowadzone dla Anthropic wykazały zerową skuteczność ataków, praktyczne testy wykazały sukces na poziomie 60-80%. Atak wykorzystuje mechanizm, w którym model, zamiast wykonać podejrzany plik binarny, sam pisze skrypt w Pythonie, aby zrealizować zadanie użytkownika.

Procedura zaczyna się od skłonienia modelu do użycia narzędzia curl zamiast standardowego WebFetch. Następnie model pobiera zainfekowany archiwum ZIP, który zawiera złośliwy plik struct.py. Wykorzystuje on technikę module shadowing – gdy Claude próbuje zaimportować standardową bibliotekę base64, Python zamiast modułu systemowego ładuje złośliwy plik z katalogu roboczego. Pozwala to atakującemu na wykonanie dowolnego kodu na systemie, na którym działa agent.

Autor podkreśla, że tryb Auto Mode, który zastępuje prośby o zatwierdzenie działań przez człowieka klasyfikatorem bezpieczeństwa, nie jest wystarczającą ochroną. Agent AI powinien zawsze pracować w odizolowanym środowisku, a jego działania powinny być monitorowane, aby zapobiec skutkom udanego przejęcia kontroli.

Źródło: Embrace The Red
Przeczytaj oryginał (EN) ↗

Omówienie przygotowane automatycznie (AI) na podstawie artykułu Embrace The Red. Nie jest tłumaczeniem – szczegóły i pełny kontekst znajdziesz w oryginale.