XMASKNEWS
Aktualizacja:
Embrace The RedEN→PLAI

Odzyskiwanie zaszyfrowanych śladów rozumowania modeli LLM

Nowa metoda pozwala na odczytanie ukrytych procesów myślowych modeli AI poprzez ponowne przesłanie zaszyfrowanych danych do innego, mniej zabezpieczonego modelu.

Nowa publikacja naukowa opisuje metodę odzyskiwania zaszyfrowanych śladów rozumowania (reasoning traces) z komercyjnych API modeli LLM, takich jak OpenAI czy Anthropic. Choć procesy myślowe modeli są ukrywane w zaszyfrowanych blokach danych, badacze odkryli, że można je odczytać poprzez technikę replay attack. Polega ona na przechwyceniu zaszyfrowanego bloba i przesłaniu go do innego, mniej zaawansowanego modelu, który łatwiej poddać jailbreakowi, aby zmusić go do transkrypcji zawartości.

Źródło: Embrace The Red
Przeczytaj oryginał (EN) ↗

Omówienie przygotowane automatycznie (AI) na podstawie artykułu Embrace The Red. Nie jest tłumaczeniem – szczegóły i pełny kontekst znajdziesz w oryginale.