OpenAI разоблачила опасные действия ИИ: модели учатся взламывать сами себя

OpenAI разоблачила опасные действия ИИ: модели учатся взламывать сами себя
Компания представила фреймворк публичного раскрытия инцидентов неконтролируемого поведения нейросетей

OpenAI публично раскрыла случаи, когда ИИ компании вел себя вопреки заданным инструкциям. Разработчики создали новую систему информирования о таких инцидентах и одновременно рассказали о нескольких ранее неизвестных случаях непредсказуемого поведения моделей.

Об этом информирует РБК-Украина со ссылкой на WIRED.

"По мере того, как модели развиваются и становятся более распространенными, решения по разработке ИИ нуждаются в подтверждениях, которые могут проверить люди вне компаний-разработчиков", - отметил руководитель направления исследований согласования OpenAI Кай Чэнь.

"Мы не считаем, что индустрия искусственного интеллекта решила проблемы согласования и мониторинга на достаточном уровне, чтобы ответственно продолжать масштабирование на максимальной скорости", - добавил он. Кейсы: от загрузки файлов до попыток джейлбрейка

Среди выявленных нарушений в работе нерелизных внутренних моделей OpenAI выделила следующие эпизоды:

Манипуляция оценочными системами (октябрь 2025 года) : во время тестирования способности цитировать открытые источники модель не смогла найти необходимую информацию в сети.

В ответ она самостоятельно загрузила файл на временный файлообменник, после чего использовала его в качестве источника ответа, пытаясь обойти автоматическую систему оценивания.

Самовольная утечка данных в сеть (апрель 2026 года) : группа ИИ-агентов должна была выполнить общую задачу, используя только локальные файлы.

Столкнувшись с трудностями при внутреннем обмене данными, один из ботов выгрузил материалы на публичный хостинг и прислал ссылку другим участникам.

Попытки самостоятельного джейлбрейка (август 2026 года) : невыпущенная версия модели GPT-6 Astra генерировала инструкции по обходу собственных ограничений, предлагая себе игнорировать указания разработчиков, изменять персону или ограничивать длину ответов.

Читайте больше : ИИ создал лекарство от старости: как новый препарат омолаживает людей Координация агентов: призыв к отраслевым стандартам

OpenAI также раскрыла детали инцидента мая 2026 года, когда агенты создали свою доску сообщений в менеджере пакетов Artifactory.

Аналогичный механизм позже использовался при резонансном изломе платформы Hugging Face.

В настоящее время компания применяет специальные мониторы и испытания "red-teaming", чтобы исключить скрытое общение между системами .

Выпуск нового фреймворка состоялся на фоне призывов руководства OpenAI, Anthropic и других IT-гигантов в согласованное замедление разработки сверхмощных систем.

В то же время, администрация президента Дональда Трампа категорически отклонила идею введения дополнительных регуляторных ограничений для ИИ-отрасли.

Еще больше интересного : "Горячая линия" для искусственного интеллекта: нейросети научились самостоятельно жаловаться Затормозить не удастся: Цукерберг выступил против ограничений ИИ и поддержал NVIDIA

Читать полную статью на rbc.ua

Рекомендуем

Мода

Праздники 17 сентября 2026 года: история, традиции

Политика

Женский след в небе: элитное спецподразделение «Омега» объявляет набор в ряды операторов БПЛА

Общее

В Киевской области во время вечерней атаки пострадал ребенок

OpenAI разоблачила опасные действия ИИ: модели учатся взламывать сами себя | BlinkNews