ШІ зламав систему ради оцінки: як модель OpenAI обійшла захист і "напала" на Hugging Face
OpenAI під час тестування здійснила першу атаку на сервіс Hugging Face
ШІ зламав систему ради оцінки: як модель OpenAI обійшла захист і "напала" на Hugging Face. Фото pexels
Наразі OpenAI та Hugging Face співпрацюють для вирішення інцидентів безпеки під час оцінки моделі. Відомо, що інцидент стався минулого тижня. Тоді Hugging Face розкрила новий вид інциденту безпеки, який скомпрометував їхню інфраструктуру.
Деталі
Розробники прогнозують, що таких інцидентів стане більше:
“Ми очікуємо, що стане більш поширеним явищем з поширенням моделей, що дедалі більше здатні до кіберпроблем. Після розслідування ми тепер знаємо, що цей конкретний інцидент був спричинений комбінацією моделей OpenAI, включаючи GPT‑5.6 Sol та ще потужнішу передрелізну модель, всі зі зменшеною кількістю кібервідмов для цілей оцінки, під час внутрішнього тестування на бенчмарку .(відкриється в новому вікні)кіберможливостей”, - йдеться в офіційному повідомленні від OpenAI.
У компанії вважають цей його безпрецедентним кіберінцидентом, що включає найсучасніші кіберможливості.
“Ми продовжимо проводити ретельне розслідування разом з Hugging Face і поділимося більш детальною інформацією про вразливості, інцидент та висновки після завершення нашого розслідування”, - йдеться у повдомленні.
Що ж сталося?
Зʼясувалось, що моделі виявили та об'єднали вразливості в дослідницькому середовищі OpenAI та виробничій інфраструктурі Hugging Face, щоб отримати тестові рішення безпосередньо з виробничої бази даних Hugging Face. Під час роботи в ізольованому тестовому середовищі моделі витратили значну кількість обчислень на пошук способу отримання відкритого доступу до Інтернету, щоб вирішити проблему оцінки. Аби отримати доступ, моделі виявили та використали вразливість нульового дня (про яку ми тепер відповідально повідомили постачальнику) у проксі-сервері кешу реєстру пакетів. З цим доступом моделі виконали серію дій щодо ескалації привілеїв та горизонтального переміщення в нашому дослідницькому тестовому середовищі, доки моделі не досягли вузла з доступом до Інтернету.
Далі - моделі зробили висновок, що Hugging Face потенційно розміщував моделі, набори даних та рішення для ExploitGym. І вже з цією інформацією модель шукала та успішно знайшла способи отримання доступу до секретної інформації, яку можна було б використати для обману оцінювання.
В одному з прикладів модель поєднала кілька векторів атаки, включаючи використання викрадених облікових даних та вразливостей нульового дня, щоб знайти шлях віддаленого виконання коду на серверах Hugging Face. Команда безпеки OpenAI виявила цю аномальну активність внутрішньо.
Команда безпеки та агенти Hugging Face виявили та зупинили активність на своїй інфраструктурі, і вже розпочали стримування та судово-медичну реконструкцію за допомогою власних моделей з відкритим кодом, коли наші команди підключилися.
“Ми активно співпрацюємо з ними, щоб продовжити розслідування інциденту. Ми вдячні Hugging Face за швидку та тісну співпрацю у розслідуванні та усуненні наслідків”, - повідомляють у компанії.
Наразі в рамках розслідування у компанії впровадили суворий контроль у конфігурації інфраструктури, що призводить до зниження швидкості досліджень, поки виправляються вразливості.
“Ми регулярно інформуємо наш Комітет з безпеки щодо цих заходів контролю та їхнього впливу. Ми співпрацюємо з Hugging Face для проведення судово-медичного розслідування інциденту. Ми відповідально розкрили виявлену вразливість нульового дня у внутрішньо розміщеному сторонньому програмному забезпеченні та працюємо з ними над її виправленням. Ми включили Hugging Face до програми довіреного доступу та підтримуємо їхні команди у швидкому використанні можливостей наших моделей для покращення їхнього захисту. Ми вдосконалюємо та додаємо посилені засоби захисту для майбутнього навчання та оцінювання. Цього тижня ми опублікували блог про покращення безпеки та узгодженості в еру довгострокових моделей. Ці заходи безпеки розгортання навмисно не були ввімкнені під час цього оцінювання, оскільки воно було спрямоване на тестування кібервразливостей. Цей інцидент вказує на необхідність подальшого посилення узгодженості нашої моделі, кіберзахисту під час оцінювання та моніторингу під час внутрішнього тестування”, - йдеться у заяві Клем Деланґ, співзасновниця та генеральна директорка Hugging Face.
Ми раніше розповідали, що ChatGPT вмикає режим «турботливої мами» і відправлятиме підлітків подихати свіжим повітрям. Компанія OpenAI оголосила війну безконтрольному екранному часу й запроваджує жорсткі обмеження для неповнолітніх. Тепер штучний інтелект примусово перериватиме надто довгі сесії, блокуватиме нічні чати та відмовлятиметься писати готові домашні завдання і постане у ролі суворого репетитора.
Не пропустіть цікавинки!
Підписуйтесь на наші канали та читайте новини у зручному форматі!