Czy „Red Team wygrał” to dobra wiadomość? LLM-y najpierw czytają słowa, a dopiero potem oceniają sytuację
Badania pokazują, że modele LLM przetwarzają emocje dwuetapowo: najpierw analizują polaryzację słów, a dopiero w późniejszych warstwach biorą pod uwagę perspektywę i cele użytkownika.
Badanie to ma istotne znaczenie dla metodologii testowania AI. Autor ostrzega, że wysoka skuteczność narzędzi typu „probe” w analizie sentymentu może być myląca, ponieważ nie zawsze wiemy, czy model faktycznie rozumie kontekst, czy jedynie rozpoznaje pojedyncze słowa.