Naukowcy opisali nową technikę ataku, która pozwala na wyciągnięcie ukrytych procesów rozumowania (chain-of-thought) z zaawansowanych modeli językowych. Problem dotyczył sposobu, w jaki dostawcy tacy jak OpenAI, Google i Anthropic przesyłali zaszyfrowane bloki danych do klientów. Okazało się, że modele z tej samej rodziny korzystały z tych samych kluczy szyfrujących, co pozwalało na ich ponowne wykorzystanie.
Kradzież śladów rozumowania z zamkniętych API modeli LLM
Badacze odkryli metodę odzyskiwania ukrytych procesów myślowych modeli Anthropic, OpenAI i Google poprzez wykorzystanie zaszyfrowanych bloków chain-of-thought.

