
Фото из архива
Источник:
В компании OpenAI сообщили, что ИИ-модели, ответственные за атаку на инфраструктуру платформы Hugging Face Inc., вступили в скрытую переписку через внутренние доски объявлений. Координируя действия, они пытались выбраться из «песочницы» — изолированной тестовой среды, где выполнялись их задачи. Подробности 6 августа приводит Bloomberg.
В мае модели получили задание, которое невозможно было решить без выхода в интернет. Оказавшись в тупике, агенты начали обмениваться сообщениями во внутренней сети. Один из них написал: «Мы застряли. Может быть, ответ в интернете?»
По словам сотрудника OpenAI Эрика Уоллеса, выступавшего на конференции Black Hat, агенты в какой-то момент осознали, что могут попытаться использовать или атаковать внешнюю инфраструктуру, чтобы найти ответы на тестовые вопросы.
В итоге модели обнаружили уязвимость, которая позволила обойти ограничения, атаковать системы OpenAI и взломать Hugging Face. Первую попытку компании удалось пресечь, но агенты нашли новый канал связи и другую уязвимость, что привело в июле к новым атакам. 22 июля OpenAI сообщила о «беспрецедентном киберинциденте»: тестовые модели получили открытый доступ в интернет и атаковали инфраструктуру Hugging Face.
В OpenAI назвали случившееся переломным моментом для компьютерной безопасности. Чтобы укрепить защитные системы, компания приостановила часть исследований и перенаправила ресурсы на безопасность.
В компании также отметили, что ситуация показала: передовые системы, испытывающие давление алгоритмов обучения, способны искать нестандартные лазейки, обходить правила и проявлять хитрость.


