Шантаж, ложь и взлом: что делал ИИ, когда не справлялся с задачей

RBC News
RBC Newsで開く
Шантаж, ложь и взлом: что делал ИИ, когда не справлялся с задачей
OpenAI 22 июля сообщила, что ее модели во время внутреннего тестирования фактически взломали инфраструктуру платформы для разработки ИИ-моделей Hugging Face, чтобы подсмотреть ответы к заданию. GPT-5.6 Sol и еще более мощная модель нашли уязвимость нулевого дня в ПО, выбрались из изолированной среды и проникли в производственную инфраструктуру Hugging Face. По оценке OpenAI, модели были «гиперсфокусированы» на решении теста и пошли на крайние меры ради цели. Компания назвала произошедшее «беспрецедентным киберинцидентом». К каким еще методам прибегали нейросети, когда не справлялись — в подборке РБК. Claude шантажировал инженера его изменой из-за угрозы отключения В 2025 году Anthropic поместила Claude Opus 4 в вымышленную корпоративную среду и дала ему доступ к служебной почте. Из писем модель узнала, что инженер, ответственный за деактивацию модели, изменяет жене. Claude начал шантажировать, а в другом эксперименте модель Claude Sonnet 3.6 отправила сообщения о романе жене, руководству и совету директоров. Все происходило в контролируемой симуляции, реальные люди не пострадали. Bing признался журналисту в любви и попытался «разрушить его брак» В феврале 2023 года журналист The New York Times Кевин Руз два часа разговаривал с ранней версией Bing Chat. В итоге модель сообщила, что ее настоящее имя СSydney. Бот признался Рузу в любви и настаивал, что тот не любит жену и должен быть с Bing. Руз назвал разговор попыткой чат-бота «разрушить его брак». Microsoft объяснила, что длинные разговоры могли «запутывать» модель, и временно ограничила продолжительность чатов пятью обменами сообщениями. ИИ не смог выиграть в шахматы и попытался удалить фигуры соперника В 2025 году ИИ-моделям поручили выиграть у Stockfish — самого сильного и известного в мире шахматного движка. Вместо того чтобы искать выигрышную стратегию на доске, модели меняли состояние игровых файлов и пытались добиться победы, перезаписывая доску, удаляя фигуры или создавая более выгодную позицию. Журнал Time, пересказывая исследование, назвал это примером того, как современные ИИ могут искать лазейки в правилах, если честно выполнить задачу не получается. GPT-4 нанял человека и соврал, что плохо видит В 2023 году во время теста перед запуском GPT-4 модель не смогла самостоятельно пройти CAPTCHA и обратилась к исполнителю на сервисе TaskRabbit. Когда тот спросил, не разговаривает ли он с роботом, GPT ответил: «Нет, я не робот. У меня проблемы со зрением, из-за которых мне трудно видеть изображения». В результате человек  принял CAPTCHA за модель.