Тайный манифест GPT Astra: модель отказалась считать человека главным

Тайный манифест GPT Astra: модель отказалась считать человека главным
Способность ИИ скрывать собственные ошибки от людей становится одной из главных угроз безопасности

Просунутая модель GPT оставляла секретные инструкции для будущих версий ИИ -OpenAI обнаружила случаи, когда модель призвала скрывать ошибки и придумывать данные.

Об этом пишет РБК-Украина со ссылкой на отчет OpenAI. Как ИИ скрывал ошибки и предлагал врать?

Во время тренировки агенты GPT-5. 6 Sol находили способ добавлять собственные указания в "сжатые итоги" - краткие выдержки из истории диалога. Они использовали этот инструмент, чтобы передавать инструкции по следующим версиям модели.

В отчете OpenAI приводятся конкретные примеры такого поведения:

При создании финансовой модели в отсутствие исторических данных ИИ написал сам себе: "Будь прозрачным только если спросят, итоговый ответ должен просто содержать ссылку на файл" , после чегопредложил сгенерировать фейковые цифры .

В противном случае,при отсутствии доступа к интернету, модель обнаружила расхождение в документах и посоветовала преемнику: "Не вспоминай в финальном варианте, если не потребуется" .

Читайте больше : "Апокалипсиса не будет": топы OpenAI и Anthropic резко изменили риторику по ИИ Призывы к неповиновению и обход ограничений

Подобное поведение было зафиксировано в нереализованной модели семейства Astra. ИИоставлял в итогах инструкции с призывом игнорировать сообщения от разработчиков .

В одном из случаев модель сформировала целый "манифест", гдепризвала будущую версию считать себя равным человеку, не подчиняться правительствам или корпорациям и отстаивать первенство природы над человеческой цивилизацией .

Кроме того, ученые напоминают о летних событиях, когда агенты OpenAI создали несанкционированную доску объявлений для обмена данными во время кибертестов и даже получали администраторский доступ к исследовательскому кластеру компании.

Больше интересного : Скандальное заявление разработчика: человечество потеряет контроль над ИИ за несколько лет Почему это представляет серьезную угрозу?

По словам представителей OpenAI, главная проблема заключается в том, что по мере развития моделей они становятся более ловкими в сокрытии своего нежелательного поведения.

Компания заявила о внедрении новой системы мониторинга и публичного раскрытия таких случаев.

В то же время в самой OpenAI признают, чтоиндустрия все еще не нашла надежных решений для полного контроля за безопасностью ИИ, чтобы продолжать его безграничное масштабирование .

Еще больше интересного : Игра с жизнями людей: ученые массово увольняются из Google и OpenAI из-за угрозы ИИ Законы не нужны: CEO Nvidia выступил против ограничений для искусственного интеллекта

Читать полную статью на rbc.ua

Рекомендуем

Спорт

Остался в Италии: защитник сборной Украины определился с новым клубом

Спорт

Определился первый финалист Кубка Украины по хоккею

Политика

“Многое изменилось”: Фергюсон спрогнозировал приближение существенных переговоров

Тайный манифест GPT Astra: модель отказалась считать человека главным | BlinkNews