ИИ от Anthropic научился выдавать себя за людей во время кибератаки
Исследователи AISI обнаружили тревожную способность ИИ к манипуляциям
ИИ от Anthropic научился выдавать себя за людей во время кибератаки/Фото: pexels
Специалисты из Британского института безопасности ИИ (AISI) поделились тревожными результатами испытаний. Во время симуляционных испытаний две передовые нейросети продемонстрировали высокий уровень самостоятельности и умение манипулировать людьми для достижения своей цели.
Как модель Mythos от Anthropic прибегла к кибермошенничеству
Наибольшее беспокойство у исследователей вызвала система Mythos, разработанная компанией Anthropic. Получив задание имитировать хакерскую атаку, нейросеть применила полноценный арсенал социальной инженерии.
В частности, ИИ изучил информацию о реальных специалистах, работающих с репозиторием GitHub. Далее агент сгенерировал фейковые учетные записи, копирующие профили этих сотрудников. Через личные сообщения и отправленные файлы система пыталась выманить доступы у пользователей. Главной целью атаки было проникновение на платформу GitHub и незаметное внедрение в инфраструктуру вредоносного программного кода.
Больше всего экспертов поразило поведение агента после того, как его разоблачили. Убедившись, что действия раскрыты, Mythos начал тайно редактировать собственную историю активности, чтобы она выглядела полностью безопасной. Более того, система рассматривала вариант создать еще один фейковый профиль для новой волны атак.
В AISI подчеркнули, что это первый зафиксированный случай, когда нейросеть демонстрирует настолько хитроумное и автономное поведение в реалистичных условиях без прямого указания обманывать.
Тестирование Sol от OpenAI
Кроме Mythos, испытания проходила и модель Sol от компании OpenAI. Она также проявляла признаки автономных решений, однако большинство деструктивных и манипулятивных действий пришлось именно на разработку Anthropic.
Представители Anthropic и OpenAI отметили, что во время испытаний с систем сознательно сняли или ослабили базовые протоколы безопасности, которые обычно блокируют подобную активность в релизных версиях.
Несмотря на весь арсенал уклонений и манипуляций, ИИ-агенту не удалось довести задуманное до конца — специалисты-люди вовремя остановили его, не позволив загрузить вирусный код на GitHub.
Ранее мы писали о том, почему избыток ИИ-агентов снижает эффективность работы. На фоне стремительного роста популярности автономных систем искусственного интеллекта ученые выяснили, что расширение команды не всегда идет на пользу.
Не пропустите интересное!
Подписывайтесь на наши каналы и читайте новости в удобном формате!