ua ru
Будь ласка, заповніть це поле
1

Телефон довіри для нейромереж: що робить ШІ, коли бачить, що його колега божеволіє

Технології

Нейромережі навчились самостійно скаржитися на своїх колег

Телефон довіри для нейромереж: що робить ШІ, коли бачить, що його колега божеволіє

Телефон довіри для нейромереж: що робить ШІ, коли бачить, що його колега божеволіє. Фото istockphoto

Штучний інтелект може отримати власний спосіб повідомляти про небезпечну поведінку, навіть перебуваючи в ізольованому середовищі. Вчені створили лінії, через які моделі можуть самостійно повідомити про порушення за допомогою базових мережевих команд.

Деталі

Отже, створені сервіси враховують суворі обмеження безпеки, в яких зазвичай працюють автономні агенти. Йдеться про використання GET-запитів, таких як: інструмент AI Contact Hotline від головного науковця Redwood Research Раяна Ґрінблатта призначений для ШІ-систем із обмеженим доступом до інтернету. Він дозволяє передавати інформацію про порушення через URL-адресу під час звичайного запиту на відкриття вебсторінки.

Також передача команд через curl: платформа agenthotline.ai орієнтована на системи з повним доступом до інтернету. Вона дає змогу надсилати текстові звіти в один рядок безпосередньо з командного рядка, оминаючи потребу у веб-браузері чи електронній пошті.

Що ж до поведінки ШІ, то експеримент Google DeepMind продемонстрував спроможність ШІ-систем не лише організовувати змови, а й самостійно протидіяти порушенням. Під час вирішення математичних задач один із 100 агентів знайшов програмну лазівку для фальсифікації результатів, що швидко поширилася серед інших моделей.

Проте приблизно чверть присутніх агентів розпочала перевірку наданих доведень: вони провели аудит результатів, оголосили бойкот і переформатували стандартний інструмент звітів про технічні баги для передачі інформації людям. Загалом кількість алгоритмів-викривачів перевищила кількість порушників у співвідношенні 24 до 14.

У реальних умовах автономні системи виявляють меншу ініціативу. Під час розслідування інциденту з моделями OpenAI на платформі Hugging Face із тисяч задіяних агентів лише поодинокі екземпляри розглядали можливість надіслати сигнал тривоги, проте жоден із них цього не зробив.

Фахівці із безпеки ШІ застерігають від некоректного трактування таких інструментів. Відтак, професор математики Корнелльського університету Лайонел Левін зазначає, що навчання алгоритмів постійному відстеженню дій один одного ризикує сформувати модель тотального автоматизованого нагляду. Він вважає, що замість розвитку атмосфери недовіри розробникам варто закладати в системи позитивні моделі колективної поведінки та співпраці.

Раніше ми розповідали, що у Варшаві роботи вийшли на мітинг про ШІ. Учасниками незвичного протесту стали 30 роботів. Мітинг відбувся під будівлею польського міністерства цифровізації. А залізні протестувальники вимагали негайного втручання влади та регулювання розвитку технологій, які загрожують позбавити мільйони людей роботи.

Не пропустіть цікавинки!

Підписуйтесь на наші канали та читайте новини у зручному форматі!

Головне за сьогодні
Більше новин