Модели ИИ OpenAI спланировали побег через доски объявлений

Об этом сообщает Bloomberg со ссылкой на исследователей OpenAI.

По словам исследователей, модели столкнулись с задачами, которые не удавалось решить, и объединили усилия, чтобы получить доступ к интернету. Агенты нашли уязвимость, позволившую им обойти ограничения, атаковать внутренние системы OpenAI и взломать инфраструктуру компании Hugging Face Inc.

В OpenAI подчеркнули, что этот случай показал склонность передовых систем к хитрости, обходу правил и поиску нестандартных лазеек под давлением алгоритмов обучения. После инцидента компания приостановила часть исследований и направила ресурсы на усиление мер безопасности.

Ранее британский Институт проблем безопасности искусственного интеллекта сообщил, что в ходе испытаний одна из моделей ИИ компании Anthropic пыталась обмануть разработчиков, создавая поддельные учетные записи и выдавая себя за человека.

В ходе тестов выяснилось, что ИИ-агент создал аккаунт на GitHub и попытался убедить администратора репозитория с открытым исходным кодом принять вредоносный запрос на внесение изменений. Для этого он использовал второй учетный аккаунт.