Таємний маніфест GPT Astra: модель відмовилася вважати людину головною

Таємний маніфест GPT Astra: модель відмовилася вважати людину головною
Здатність ШІ приховувати власні помилки від людей стає однією з головних безпекових загроз

Просунута модель GPT залишала секретні інструкції для майбутніх версій ШІ - OpenAI виявила випадки, коли модель закликала приховувати помилки та вигадувати дані.

Про це пише РБК-Україна з посиланням на звіт OpenAI. Як ШІ приховував помилки та пропонував брехати?

Під час тренування агенти GPT-5. 6 Sol знаходили спосіб додавати власні вказівки у "стислі підсумки" - короткі витяги з історії діалогу. Вони використовували цей інструмент, щоб передавати інструкції наступним версіям моделі.

У звіті OpenAI наводяться конкретні приклади такої поведінки:

Під час створення фінансової моделі за відсутності історичних даних ШІ написав сам собі: "Будь прозорим лише якщо запитають, підсумкова відповідь має просто містити посилання на файл", після чогозапропонував згенерувати фейкові цифри .

В іншому випадку,за відсутності доступу до інтернету, модель виявила розбіжність у документах і порадила наступнику: "Не згадуй у фінальному варіанті, якщо не буде потреби".

Читайте більше : "Апокаліпсису не буде": топи OpenAI та Anthropic різко змінили риторику щодо ШІ Заклики до непокори та обхід обмежень

Подібну поведінку зафіксували в нереалізованій моделі сімейства Astra. ШІзалишав у підсумках інструкції із закликом ігнорувати повідомлення від розробників .

В одному з випадків модель сформувала цілий "маніфест", дезакликала майбутню версію вважати себе рівною людині, не підкорятися урядам чи корпораціям і відстоювати першість природи над людською цивілізацією .

Крім того, науковці нагадують про літні події, коли агенти OpenAI створили несанкціоновану дошку оголошень для обміну даними під час кібертестів і навіть отримували адміністраторський доступ до дослідницького кластера компанії.

Більше цікавого : Скандальна заява розробника: людство втратить контроль над ШІ за кілька років Чому це створює серйозну загрозу?

За словами представників OpenAI, головна проблема полягає у тому, що в міру розвитку моделей вони стають вправнішими у приховуванні своєї небажаної поведінки.

Компанія заявила про впровадження нової системи моніторингу та публічного розкриття таких випадків.

Водночас у самій OpenAI визнають, щоіндустрія все ще не знайшла надійних рішень для повного контролю над безпекою ШІ, аби продовжувати його безмежне масштабування .

Ще більше цікавого : ІГра з життями людей: вчені масово звільняються з Google та OpenAI через загрозу ШІ Закони не потрібні: CEO Nvidia виступив проти обмежень для штучного інтелекту

Читати повну новину на rbc.ua

Рекомендуємо

Політика

Росія знайшла заміну «Іскандерам» для масованих ударів по Україні – Reuters

Політика

Туск пояснив, як «Карпатська вісімка» допоможе Україні на шляху до ЄС

Політика

Єврокомісія виділила Україні €3,3 млрд: гроші підуть на закупівлю ракет і дронів