"Гаряча лінія" для штучного інтелекту: нейромережі навчились самостійно скаржитися

"Гаряча лінія" для штучного інтелекту: нейромережі навчились самостійно скаржитися
Чи справді це має сенс?

ШІ може отримати власний спосіб повідомляти про небезпечну поведінку, навіть перебуваючи в ізольованому середовищі. Вчені створили лінії, через які моделі можуть самостійно повідомити про порушення за допомогою базових мережевих команд.

Про це пише РБК-Україна з посиланням на TechCrunch. Механізми передачі сповіщень

Створені сервіси враховують суворі обмеження безпеки, в яких зазвичай працюють автономні агенти.

Які саме?

Використання GET-запитів: інструмент AI Contact Hotline від головного науковця Redwood Research Раяна Ґрінблатта призначений для ШІ-систем із обмеженим доступом до інтернету.

Він дозволяє передавати інформацію про порушення через URL-адресу під час звичайного запиту на відкриття вебсторінки.

Передача команд через curl : платформа agenthotline. ai орієнтована на системи з повним доступом до інтернету.

Вона дає змогу надсилати текстові звіти в один рядок безпосередньо з командного рядка, оминаючи потребу у веб-браузері чи електронній пошті.

Більше цікавого : ШІ створив ліки від старості: як новий препарат омолоджує людей Поведінка ШІ-агентів у тестових та реальних умовах

Експеримент Google DeepMind продемонструвавспроможність ШІ-систем не лише організовувати змови, а й самостійно протидіяти порушенням .

Під час вирішення математичних задач один із 100 агентів знайшов програмну лазівку для фальсифікації результатів, що швидко поширилася серед інших моделей.

Проте приблизно чверть присутніх агентів розпочала перевірку наданих доведень:вони провели аудит результатів, оголосили бойкот і переформатували стандартний інструмент звітів про технічні баги для передачі інформації людям .

У підсумку кількість алгоритмів-викривачів перевищила кількість порушників у співвідношенні 24 до 14.

У реальних умовах автономні системи виявляють меншу ініціативу .

Під час розслідування інциденту з моделями OpenAI на платформі Hugging Face із тисяч задіяних агентів лише поодинокі екземпляри розглядали можливість надіслати сигнал тривоги, проте жоден із них цього не зробив.

Читайте більше : "Ми створили інопланетний розум": вчені OpenAI налякані прогресом ШІ Ризики формування цифрового нагляду

Фахівці із безпеки ШІ застерігають від некоректного трактування таких інструментів.

Так, професор математики Корнелльського університету Лайонел Левін зазначає, щонавчання алгоритмів постійному відстеженню дій один одного ризикує сформувати модель тотального автоматизованого нагляду .

На його думку, замість розвитку атмосфери недовірирозробникам варто закладати в системи позитивні моделі колективної поведінки та співпраці .

Ще більше цікавого : Небезпечна помилка Anthropic: Claude Mythos 5 зламав капчу й атакував інтернет Небезпечна маніпуляція ChatGPT: чат-бот видавав себе за Бога

Читати повну новину на rbc.ua

Рекомендуємо

Спорт

УЄФА дозволив білоруським юнацьким командам виступати у російському чемпіонаті – представник АБФФ

Бізнес

Найвищі дизельні ціни наблизились до 100 гривень: що буде далі

Загальне

Вчені створили мишей із наполовину людським мозком

"Гаряча лінія" для штучного інтелекту: нейромережі навчились самостійно скаржитися | BlinkNews