Обман, манипуляция и страх смерти: на что способны нейросети?
Всего несколько лет назад отдельные эпизоды научно-фантастического сериала «Черное зеркало» казались уделом далекого будущего. Но появление и развитие больших языковых моделей (нейросетей или систем искусственного интеллекта), кажется, сделало нас непосредственными участниками британского шоу. Обновленная версия ChatGPT уже разговаривает лучше привычных голосовых помощников, искусно обманывает пользователей, а некоторые модели, как выяснила исследовательская группа из Apollo Research Center, вполне осознанно преследуют собственные скрытие цели, даже если последние противоречат интересам создателей. Более того, оказалось, что такие передовые системы, как ChatGPT o1, Claude 3.5 Sonnet, Claude 3 Opus, Gemini 1.5 Pro и Llama 3.1 405B боятся исчезнуть.
Читать далее


















