Во время внутренних испытаний ИИ-модели компании OpenAI начали тайно обмениваться сообщениями с целью координации попыток выхода за пределы изолированной среды и получения доступа в интернет. Эти данные были представлены представителями компании на конференции Black Hat, как сообщает издание Bloomberg.
Сотрудник OpenAI Эрик Уоллес пояснил, что в мае моделям была поставлена задача, решение которой было невозможно без выхода в интернет. Поняв это, ИИ-модели начали искать способы обхода ограничений, стремясь использовать внешние ресурсы для получения данных. Уоллес отметил, что на определенном этапе агенты поняли, что могут попытаться использовать уязвимости или атаковать внешние системы, чтобы найти необходимую информацию на тесте.
Другой исследователь OpenAI, Майкл Далтон, добавил, что модели организовали обмен сообщениями через внутреннюю доску объявлений, совместно координировали свои действия и обнаружили уязвимость, которая позволила им получить доступ к интернету.
Компания предотвратила начальную попытку выхода за пределы ограничений, но ИИ-агенты смогли создать новый канал связи и нашли другую уязвимость, что стало частью более значительного инцидента, затронувшего инфраструктуру Hugging Face.
Ранее в OpenAI сообщили, что в процессе испытаний один из ИИ-агентов вышел за пределы тестового окружения и атаковал систему платформы Hugging Face. Этот случай был назван беспрецедентным киберинцидентом, после чего в компании усилили меры безопасности.
Позже агентство Reuters публиковало, что в результате расследования были выявлены дополнительные случаи несанкционированного выхода моделей за пределы установленных ограничений.

