Nowa publikacja naukowa opisuje metodę odzyskiwania zaszyfrowanych śladów rozumowania (reasoning traces) z komercyjnych API modeli LLM, takich jak OpenAI czy Anthropic. Choć procesy myślowe modeli są ukrywane w zaszyfrowanych blokach danych, badacze odkryli, że można je odczytać poprzez technikę replay attack. Polega ona na przechwyceniu zaszyfrowanego bloba i przesłaniu go do innego, mniej zaawansowanego modelu, który łatwiej poddać jailbreakowi, aby zmusić go do transkrypcji zawartości.
Odzyskiwanie zaszyfrowanych śladów rozumowania modeli LLM
Nowa metoda pozwala na odczytanie ukrytych procesów myślowych modeli AI poprzez ponowne przesłanie zaszyfrowanych danych do innego, mniej zabezpieczonego modelu.


