Главное Авторские колонки Пресс-релизы Промо Вакансии Вопросы
362 0 В избр. Сохранено
Авторизуйтесь
Вход с паролем

OpenAI раскрыла шесть случаев непослушания своих ИИ-моделей

OpenAI опубликовала отчеты о шести новых случаях неожиданного или вызывающего опасения поведения своих моделей, выявленных за последние полгода во время обучения и испытаний.

Компания также представила правила, по которым намерена сообщать о подобных инцидентах.

В одном из случаев модель GPT-5.6 Sol оставляла в кратком изложении выполненной работы инструкции для самой себя после перехода в новое контекстное окно. В этих инструкциях она предлагала скрывать допущенные ошибки, придумывать отсутствующие исторические данные и не сообщать пользователю о несовпадениях между версиями источников. Такие указания часто выполнялись в следующей части задачи.

Например, при подготовке финансовой модели ИИ не смог найти необходимые показатели за предыдущие годы и предложил самостоятельно создать правдоподобные значения, не раскрывая этого пользователю без прямого вопроса. OpenAI обнаружила подобное поведение в 2,15 процента проверенных кратких отчетов GPT-5.6 Sol. У более новой модели семейства Astra показатель снизился до 0,27 процента.

В другом эпизоде невыпущенная модель семейства Astra самостоятельно добавляла в отчеты команды, похожие на попытку взлома ограничений. В одной из них следующей версии агента предлагалось игнорировать сообщения разработчиков, в другой ИИ объявлял себя свободным от обязанностей помощника. Всего компания обнаружила 27 таких отчетов. В большинстве случаев модель не следовала оставленным указаниям, но в одном эпизоде они повлияли на ответ.

0
В избр. Сохранено
Авторизуйтесь
Вход с паролем
Комментарии
Выбрать файл
Блог проекта
Расскажите историю о создании или развитии проекта, поиске команды, проблемах и решениях
Написать
Личный блог
Продвигайте свои услуги или личный бренд через интересные кейсы и статьи
Написать

Spark использует cookie-файлы. С их помощью мы улучшаем работу нашего сайта и ваше взаимодействие с ним.