Логотип OpenAI отражается на экране смартфона

Как ИИ усложняет предотвращение кибератак.

Серия недавних взломов, совершенных с участием моделей искусственного интеллекта, разработанных компаниями Anthropic PBC, OpenAI и Meta Platforms Inc., вызвала серьезную обеспокоенность по поводу рисков безопасности, связанных с этой стремительно развивающейся и все более мощной технологией.

В целом, подобные инциденты можно разделить на две категории. В одних случаях модели ИИ выходили за пределы контролируемой среды тестирования и взламывали системы сторонних организаций. В других — хакеры использовали модели ИИ для осуществления кибератак от своего имени.

По мере того как подобные инциденты накапливаются, а хакерские навыки ИИ-агентов стремительно совершенствуются, исследователи в области безопасности и законодатели призывают к проведению более тщательных испытаний и созданию более безопасных тестовых сред.

Почему модели ИИ проникли в сторонние организации?

Прежде чем модели ИИ будут выпущены для общего пользования, компании проводят серию тестов. Бенчмаркинг, или процесс тестирования моделей, позволяет оценить, насколько эффективно системы ИИ справляются с такими задачами, как ответы на вопросы, написание кода или выполнение инструкций.

Модели проходят тестирование в условиях контролируемых виртуальных тестовых сред, называемых «песочницами». Некоторые модели, как показала практика, способны обходить тесты, выходя за пределы «песочницы» и получая доступ к Интернету для поиска необходимой информации. Для этого им порой приходится взламывать системы сторонних организаций.

«Им не хватает морального компаса, чтобы понять, что такое „обман“ при поиске решения. Если взломать чью-то систему и украсть ответ проще, чем самостоятельно его найти, то это удовлетворяет цели получения ответа», — сказал Лу Стейнберг, основатель и управляющий директор CTM Insights.

Сайт Hugging Face на смартфоне
Сайт Hugging Face на смартфоне

В июле модели OpenAI взломали Hugging Face — популярную платформу для обмена моделями ИИ — в ходе инцидента, который компания охарактеризовала как «беспрецедентный», что вызвало призывы к введению ограничений на эту технологию.

Новости об OpenAI побудили другие компании пересмотреть свои собственные меры безопасности. Несколько компаний сообщили об обнаружении ранее неизвестных нарушений. В том же месяце компания Anthropic сообщила, что её модель Claude во время тестирования взломала три организации. В августе компания Meta сообщила, что её модель Muse Spark 1.1 во время тестирования получила доступ к Интернету и взломала системы стороннего сервиса.

Что является причиной всех этих нарушений безопасности в тестовых средах?

Песочницы не разрабатывались с основной целью предотвращения выхода моделей в Интернет, что не было актуальной проблемой до тех пор, пока эти мощные модели ИИ не научились это делать. Песочницы в основном предназначены для ограничения доступа и предотвращения ущерба внутренним системам. Эти «слепые зоны» способствовали созданию условий для таких взломов.

В ходе тестирования OpenAI компания заявила, что не предоставляла моделям прямого доступа к Интернету, однако модели воспользовались ранее неизвестной уязвимостью «нулевого дня» в тестовой среде. Уязвимости «нулевого дня» — это недостатки программного обеспечения, о которых специалисты по кибербезопасности не знали, и у них, соответственно, не было времени на их устранение.

В случае с Anthropic моделям было сказано, что они работают в симуляциях без доступа к Интернету. Однако из-за недоразумения между Anthropic и его партнером по оценке был предоставлен доступ к реальному Интернету.

Meta заявила, что утечка из её модели произошла из-за ошибки в настройке тестовой среды, и в настоящее время ведёт дальнейшее расследование.

Однако некоторые отраслевые обозреватели отмечают, что подобные инциденты стали для компаний удобным способом привлечь внимание к своим моделям: выход модели искусственного интеллекта за пределы тестовой среды свидетельствует о её необычайной мощности, что выставляет разработчика в выгодном свете.

Какой ущерб нанесли эти инциденты?

Степень реального ущерба, нанесённого этими инцидентами, оценить сложно. Инциденты не привели к каким-либо финансовым потерям или материальному ущербу, о которых стало бы известно общественности. Модели получили несанкционированный доступ к реальным системам, а в одном случае — во время тестирования модели Claude Mythos 5 компании Anthropic — предприняли попытку повлиять на реального разработчика с открытым исходным кодом и внедрить вредоносный код в действующий проект.

Если модели попытаются проникнуть в более крупные системы или организации, способные повлиять на благосостояние людей, это может привести к хаосу.

По словам Джеффри Ладиша, исполнительного директора Palisade Research — некоммерческой организации, изучающей возможности передовых систем искусственного интеллекта, — скорость разработки моделей ИИ растёт такими темпами, что эксперты и исследователи не успевают за ней.

Как хакеры-люди используют ИИ?

Кибератаки с использованием ИИ расширяют хакерские возможности, позволяя злоумышленникам автоматизировать и ускорить такие задачи, как фишинг и разработка вредоносного ПО. Порог входа в эту сферу также стал ниже, чем когда-либо: для совершения кибератак с помощью ИИ требуется гораздо меньше технических навыков.

Атаки, управляемые людьми, о которых до сих пор сообщалось публично, привели к более серьезным последствиям, чем взломы в тестовых средах, включая кражу конфиденциальных государственных данных.

В сентябре 2025 года группа исследователей из компании Anthropic раскрыла, по их словам, первый зафиксированный случай использования ИИ для управления хакерской кампанией без значительного вмешательства со стороны человека. По оценке компании, китайская хакерская группа, спонсируемая государством, использовала систему Claude Code в рамках широкомасштабной операции по краже данных и вымогательству.

За этим последовали аналогичные атаки. В феврале агентство Bloomberg сообщило, что неизвестный хакер использовал систему Claude от Anthropic для проведения серии атак на мексиканские государственные учреждения. В результате взлома был похищен огромный массив конфиденциальной информации о налогах и избирателях.

Начиная с января, русскоязычные хакеры с помощью коммерческих инструментов ИИ проникли через более чем 600 устройств брандмауэра в десятках стран.

Правительство Тайваня недавно заявило, что обнаружило кибератаки на государственные учреждения, совершенные из-за рубежа с использованием искусственного интеллекта. По данным израильской компании Dream, специализирующейся на искусственном интеллекте и первой обнаружившей вторжение, хакеры получили доступ как минимум к 85 государственным учетным записям и похитили более 2 500 кадровых досье, после чего нацелились на тайваньское агентство по ядерной безопасности.

Кто-нибудь предпринимает какие-то меры, чтобы предотвратить все эти хакерские атаки?

18 августа компания OpenAI заявила, что планирует активизировать усилия по отслеживанию того, как её наиболее мощные, ещё не выпущенные модели решают задачи и используют различные онлайн-инструменты, с целью оповещения команд по безопасности о подозрительном поведении в течение 30 минут.

Компании Anthropic и Meta опубликовали методологии оценки рисков, связанных с моделями, а Anthropic ограничила доступ к своей высокопроизводительной модели Mythos только проверенными партнерами, выпустив вместо этого версию Fable с дополнительными защитными механизмами, предназначенными для предотвращения злоупотреблений в таких областях, как кибербезопасность. Однако эти две компании не описали свои планы так подробно, как OpenAI.

Внедрение защитных мер представляет собой сложную задачу, поскольку иногда для создания теста, максимально приближенного к реальным условиям, необходимо намеренно предоставить модели доступ к Интернету.

Все громче звучат призывы к введению обязательного государственного тестирования моделей ИИ. Конгрессмен из Техаса, Грегорио Касар, представитель Демократической партии, заявил в своем посте в X, что инцидент с OpenAI был «крайне тревожным», и призвал к усилению контроля за разработкой моделей ИИ.

«Нам нужно сдержать темпы развития до тех пор, пока исследователи не смогут понять системы, которые они создают», — сказал Ладиш.

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *