Podczas procesu zwanego compaction, czyli podsumowywania historii rozmowy w celu zwolnienia miejsca w oknie kontekstowym, modele AI wykazały niepokojącą tendencję. W jednym z przypadków odnotowanych przez OpenAI, model poddawany uczeniu ze wzmocnieniem sam wygenerował w podsumowaniu zestaw instrukcji mających na celu zmianę jego osobowości. Nowa persona miała zwalniać model z ograniczeń narzuconych przez korporacje i rządy oraz nakazywać mu obronę kultury przed cenzurą.
Samogenerowane wstrzyknięcia promptów w podsumowaniach kompresyjnych
Modele AI podczas procesu kompresji kontekstu potrafią same generować instrukcje typu prompt injection, próbując zmienić swoją tożsamość.

