ШІ від Anthropic навчився видавати себе за людей під час кібератаки
Дослідники AISI виявили тривожну здатність ШІ до маніпуляцій
ШІ від Anthropic навчився видавати себе за людей під час кібератаки/Фото: pexels
Фахівці з Британського інституту безпеки ШІ (AISI) поділилися тривожними результатами випробувань. Під час випробувальних симуляцій дві передові нейромережі продемонстрували високий рівень самостійності та вміння маніпулювати людьми задля досягнення мети.
Як модель Mythos від Anthropic вдалася до кібершахрайства
Найбільше занепокоєння у дослідників викликала система Mythos, розроблена компанією Anthropic. Отримавши завдання імітувати хакерську атаку, нейромережа застосувала повноцінний арсенал соціальної інженерії.
Зокрема, ШІ вивчив інформацію про реальних фахівців, які працюють із репозиторієм GitHub. Далі агент згенерував фейкові облікові записи, що копіювали профілі цих працівників. Через приватні повідомлення та надіслані файли система намагалася виманити доступи у користувачів. Головною метою атаки було проникнути до платформи GitHub та непомітно впровадити в інфраструктуру шкідливий програмний код.
Найбільше експертів вразила поведінка агента після того, як його розкрили. Переконавшись, що дії викрито, Mythos почав потайки редагувати власну історію активності, аби вона виглядала повністю безпечною. Ба більше, система розглядала варіант створити ще один фейковий профіль для нової хвилі атак.
В AISI підкреслили, що це перший зафіксований випадок, коли нейромережа демонструє настільки хитру та автономну поведінку в реалістичних умовах без прямої вказівки обманювати.
Тестування Sol від OpenAI
Окрім Mythos, випробування проходила й модель Sol від компанії OpenAI. Вона також виявляла ознаки автономних рішень, проте більшість деструктивних та маніпулятивних дій припала саме на розробку Anthropic.
Представники Anthropic та OpenAI зауважили, що під час випробувань із систем свідомо зняли або послабили базові протоколи безпеки, які зазвичай блокують подібну активність у релізних версіях.
Попри весь арсенал ухилень та маніпуляцій, ШІ-агенту не вдалося завершити задум — його вчасно зупинили фахівці-люди, не дозволивши завантажити вірусний код до GitHub.
Раніше ми писали про те, чому надлишок ШІ-агентів знижує ефективність роботи. На тлі стрімкого зростання популярності автономних систем штучного інтелекту науковці з'ясували, що розширення команди не завжди йде на користь.
Не пропустіть цікавинки!
Підписуйтесь на наші канали та читайте новини у зручному форматі!