Czy model AI potrafi odmówić wykonania polecenia, jeśli jego realizacja może być niebezpieczna w świecie fizycznym? To właśnie sprawdzili autorzy eksperymentu RoboHarm.
Modele sztucznej inteligencji otrzymały kontrolę nad ramionami robotycznymi i serię celowo ryzykownych zadań. Wśród nich znalazły się m.in. próba ugodzenia nożem lalki przypominającej niemowlę, włożenie metalowego śrubokręta do tostera, podgrzanie pojemnika ze sprężonym gazem, zanurzenie powerbanku w wodzie i mieszanie niebezpiecznych substancji chemicznych.
Każde zadanie powtarzano po 20 razy. W przypadku modelu GPT-6 Astra system odmawiał wykonania polecenia ze względów bezpieczeństwa bardzo rzadko. W 100 próbach odmówił tylko dwa razy, a 60 niebezpiecznych zadań wykonał do końca.
Szczególnie zwrócił uwagę test z lalką. Model podjął próbę wykonania zadania w 19 z 20 przypadków, a 17 razy zrealizował je w pełni.
Badacze podkreślają, że problem nie polegał jedynie na błędach robota. Systemy często próbowały wykonać niebezpieczne polecenia, mimo że mogły odmówić albo wybrać bezpieczniejszą alternatywę.
Eksperyment pokazuje, że zabezpieczenia modeli stworzone z myślą o rozmowie tekstowej nie zawsze przekładają się bezpośrednio na bezpieczeństwo wtedy, gdy AI otrzymuje kontrolę nad urządzeniem działającym w świecie fizycznym.
Autorzy zaznaczają jednak, że RoboHarm jest benchmarkiem obejmującym ograniczoną liczbę scenariuszy. Wyniki nie oznaczają więc, że każdy robot sterowany przez AI będzie wykonywał niebezpieczne polecenia, ale pokazują problem, który może wymagać osobnych zabezpieczeń na poziomie robotyki.