XMASKNEWS
Aktualizacja:
Help Net SecurityEN→PLAI

Nowy, budżetowy model Anthropic lepiej radzi sobie z ignorowaniem ukrytych poleceń

Model Claude Haiku 5.5 od Anthropic wykazuje wyższą skuteczność w odpieraniu ataków typu prompt injection oraz lepiej radzi sobie z filtrowaniem szkodliwych zapytań niż poprzednia wersja.

Anthropic zaprezentował model Claude Haiku 5.5, który jest zoptymalizowany pod kątem szybkości i niskich kosztów. Nowa wersja charakteryzuje się znacznie lepszą odpornością na ataki typu prompt injection oraz skuteczniejszym blokowaniem złośliwych żądań, takich jak tworzenie malware czy wsparcie ataków DDoS, w porównaniu do modelu Haiku 4.5. Mimo to, model wciąż posiada pewne luki, szczególnie w scenariuszach związanych z obsługą interfejsu graficznego.

Testy wykazały, że Haiku 5.5 osiągnął 84,3% skuteczności w odrzucaniu złośliwych prób pisania kodu, co stanowi wyraźny wzrost względem poprzednika. W testach ofensywnych przeprowadzonych bez zabezpieczeń, model potrafił wykonać arbitralny kod w 4 na 410 próbach przy wykorzystaniu luk w silniku V8 przeglądarki Chrome. Anthropic podkreśla jednak, że w standardowym dostępie zabezpieczenia są znacznie bardziej restrykcyjne.

Producent zaznacza, że choć model jest odporniejszy na manipulacje, wciąż istnieją obszary wymagające uwagi, zwłaszcza w tematach wrażliwych, takich jak zdrowie psychiczne. Deweloperzy korzystający z API są zalecani do wdrażania własnych, dodatkowych mechanizmów ochronnych. Model jest dostępny na głównych platformach chmurowych i oferuje znaczące obniżki kosztów operacyjnych.