Boris Cherny wskazuje na istotny postęp w bezpieczeństwie modeli językowych. Według jego słów, najnowszy model Opus 5 okazał się najmniej podatny na ataki typu prompt injection spośród wszystkich dotychczasowych wersji.
Informacja ta wynika z wyników testów oraz przeprowadzonych działań typu red teaming. Choć szczegóły te są częściowo ukryte w dokumentacji technicznej (system card), stanowią one kluczowy wskaźnik poprawy zabezpieczeń.
Odporność na wstrzykiwanie poleceń jest jednym z najważniejszych wyzwań w rozwoju dużych modeli językowych. Sukces w tym obszarze oznacza, że model trudniej zmanipulować za pomocą złośliwych instrukcji użytkownika.

