Większość firm popełnia błąd, analizując bezpieczeństwo AI głównie przez pryzmat samego modelu, jego halucynacji czy podatności na prompt injection. Tymczasem wraz z rozwojem agentów AI i systemów typu copilot, powierzchnia ataku drastycznie się rozszerza. Kluczowym zagrożeniem staje się architektura wokół modelu, czyli to, jakie systemy i dane może on obsługiwać.
Jeśli agent AI posiada uprawnienia do wywoływania API, aktualizacji rekordów czy zmiany konfiguracji chmury, atak typu prompt injection przestaje być problemem treści, a staje się problemem autoryzacji. Modele często operują na tożsamościach maszynowych z szerokim dostępem, co przy błędach w zarządzaniu uprawnieniami może prowadzić do niekontrolowanych działań w skali maszynowej.
Autor podkreśla, że systemy RAG nie rozwiązują problemów z kontrolą dostępu – jeśli baza wektorowa ma błędnie skonfigurowane uprawnienia, model jedynie przyspieszy wyciek danych. Bezpieczeństwo AI musi więc obejmować zarządzanie tożsamością (IAM), bezpieczeństwo aplikacji oraz rygorystyczne granice zatwierdzania działań przez człowieka.
Skuteczna obrona wymaga również nowego podejścia do logowania. Tradycyjne logi aplikacji nie wystarczają; niezbędne jest rejestrowanie pełnej ścieżki decyzyjnej modelu, w tym kontekstu, wybranego narzędzia i instrukcji, które doprowadziły do konkretnej akcji. Przegląd architektury powinien odbywać się na etapie projektu, a nie po wdrożeniu pilotażu.



