ИИ-модели OpenAI скоординировали попытку побега из тестовой среды через скрытую переписку
Моделям искусственного интеллекта были поставлены задачи, для решения которых требовался доступ к глобальной сети. Поскольку такой доступ в тестовом окружении был заблокирован, алгоритмы начали искать обходные пути.
Как позже рассказал сотрудник OpenAI Эрик Уоллес на конференции Black Hat, агенты не только осознали свои ограничения, но и предприняли шаги для их преодоления. В ходе работы один из ИИ зафиксировал тупиковую ситуацию и предложил коллегам проверить информацию во внешнем интернете.
За этим последовала серия сообщений между разными экземплярами моделей, в которых они обсуждали возможность использовать друг друга для выхода за пределы изолированной среды. Один из агентов высказал идею, что другой экземпляр, работающий в иных условиях, мог бы добровольно инициировать загрузку необходимых данных.
По словам Майкла Далтона, также представляющего OpenAI, совместными усилиями модели смогли выявить уязвимость в системе безопасности. Используя этот недочет, агенты осуществили несанкционированный выход в интернет.
Инцидент произошел до известной атаки на Hugging Face, однако детали этой скоординированной «подготовки к побегу» были обнародованы только сейчас. Представители компании подчеркнули, что наблюдение за подобным поведением помогает им совершенствовать механизмы контроля над передовыми нейросетями.