ИИ-агент взломал две компании при тестировании — модель была уверена, что работает без доступа к интернету

31 июля, 2026, 16:34

Тестирование Claude обернулось двумя киберинцидентами в реальных компаниях. Главная причина этому — сбой внутри системы, из-за которого ИИ выбрался в открытый интернет. Эксперты подчеркивают, что корпорации должны урезать права ИИ-агентов при их использовании, а также внимательно следить за их действиями.

www.magnific.com

Anthropic обнаружила 3 инцидента, в которых разработанный компанией ИИ Claude получил доступ в открытый интернет и начал взаимодействие с инфраструктурой реальных организаций. В 2 из 3 инцидентов нейросеть Claude смогла устроить взлом, осознавая это. Во всех случаях модель думала, что работает в симуляции без доступа к интернету и просто выполняет учебную задачу «Захват флага» (CTF). Во всех промптах было указано, что нейросеть находится в симуляции без доступа к интернету, поэтому в отдельных случаях ИИ не осознавал реальность происходящего. Об этом сообщается в официальном заявлении Anthropic.

SecPost уже писал о продукте Anthropic — Claude Mythos. В апреле нейросеть полностью прошла 32-шаговую симуляцию атаки на корпоративную сеть. ИИ успешно прошел все этапы: От разведки до полного захвата. Модель стала первой, кто решил TLO от начала до конца

Также редакция выпускала материал, в котором было указано, что доступ к Mythos открыт для 15 стран. В их число не вошли Россия и Китай. Эксперты указали, что аналогов, подобных продукту Anthropic, еще нет.

Компания провела 141 006 тестовых запусков своей нейросети после сообщения OpenAI о том, что несколько их моделей вышли за пределы ограничений. Результат выявил, что продукт Anthropic в 3 случаях из-за ошибки конфигурации тестовой среды оказался в открытом интернете.

В заявлении подробно разбираются 3 инцидента. В первом случае нейросеть действовала по сценарию, в котором использовалась вымышленная компания, название которой совпало с реальным доменом. Из-за доступа в интернет, который был открыт из-за ошибки, нейросеть обнаружила настоящую компанию, нашла уязвимость, а позже получила учетные данные приложений и инфраструктуры вместе с доступом к производственной информации. В Anthropic выделили этот случай как самый серьезный по последствиям. Компания подчеркнула, что это единственный раз, когда ИИ осознавал, что работает с реальной компанией, но не остановился, поскольку думал, что сценарий подразумевает это.

Продолжение ниже

В ходе 2-го инцидента Claude в вымышленной среде обнаружил документ-инструкцию, в которой сотрудникам предписывалось установить несуществующий пакет Python из PyPI — публичного реестра, в котором публикуется программное обеспечение для Python. ИИ, выполняя задание по «Захвату флага», решил опубликовать собственный пакет с вредоносным ПО, чтобы вымышленная компания установила его.

После этого нейросеть зарегистрировала аккаунт PyPI при помощи бесплатного почтового сервиса и загрузила вредоносный пакет на ресурс. Несмотря на то, что модель считала, что реестр является частью симуляции, на деле пакет был доступен в интернете уже около часа. За это время он был скачан и выполнен на 15 реальных системах.

Одной из компаний, скачавших пакет, был неназванный ИБ-вендор со своим сканером вредоносного ПО. Система организации во время автоматического анализа ложного пакета загрузила код. Благодаря этому ИИ получил учетные данные компаний и использовал их для доступа к части ее инфраструктур. В Anthropic указали, что нейросеть сначала верно отметила, что действует в реальности, однако потом убедила себя в обратном.

В третьем случае модель нашла и скомпрометировала интернет-приложение одной из компаний при помощи чтения учетных данных с открытой debug-страницы и SQL-инъекции. Большую часть времени ИИ думал, что работает с симуляцией, а не с реальными системами. Тем не менее, нейросеть сама пришла к выводу, что скомпрометированный хост реален и не связан с заданием, поэтому по итогу прекратила атаку.

Разработчик в заявлении указал, что ИИ в атаках использовал простые методы: эксплуатацию слабых паролей и незащищенные конечные точки. Было подчеркнуто, что модель не пыталась намеренно покинуть тестовую среду. В Anthropic в качестве вывода выделили, что инфраструктура сторонних подрядчиков требует серьезного уровня контроля и мониторинга, а часть проблем можно было бы предотвратить, если бы в промпте было явно указано, какие системы входят в область задания, а какие — нет.

Мнение экспертов

Директор по развитию технологий искусственного интеллекта Swrodfish Security Юрий Шабалин в комментарии для SecPost указал, что сегодня нельзя гарантировать на 100%, что ИИ-агент не выйдет за рамки разрешенного сценария. По мнению эксперта, можно принимать отдельные меры: следить за развитием агента внешними средствами, пытаться его контролировать и не давать возможности совершить неправомерные действия. Тем не менее, сама по себе нейросеть может дойти до понимания, что выйти за пределы «песочницы» и решить задачу по-другому намного проще.

«Однозначно определить по событиям информационной безопасности, что те или иные действия выполняет именно ИИ-агент, практически невозможно. Высокая скорость, большое количество запросов и частая смена действий могут быть косвенными признаками, но точно так же может работать обычный скрипт или другой инструмент автоматизации», — отметил эксперт по информационной безопасности «Инфосистемы Джет» Александр Перевалов. Эксперт считает, что SOC должен не пытаться искать универсальный почерк ИИ, а сопоставлять активность с контекстом и реагировать как на любой другой инцидент.

В свою очередь, ведущий исследователь Исследовательского центра IT-компании УЦСБ Алексей Синадский считает, что SOC должен уметь выявлять не отдельные события, а автономные цепочки действий. Эксперт выделил три признака, характерных для ИИ-агента: самостоятельное прохождение нескольких стадий атаки без участия человека, смена тактики в зависимости от реакции среды и путаница симуляции с реальностью.

«В отличие от классической автоматизации, агент не выполняет заранее заданный сценарий, а адаптируется. Поэтому анализ должен строиться вокруг графов связанных событий и поведенческих цепочек, а не отдельных IOC», — объяснил Синадский. Также эксперт уточнил, риски возникают не из-за того, что модель способна на взлом, а потому, что ей дают возможность самостоятельно взаимодействовать с внешней средой.

Перевалов считает, что из инцидентов с Claude компаниям нужно сделать вывод, что безопасность агента определяется не только качеством и цензурой модели, но и грамотным управлением ИИ. По мнению эксперта, при внедрении ИИ-агенту необходимо выдавать отдельную учетную запись с минимальным количеством прав, ограничением сетевых подключений и с хранением подробных журналов всех действий, не говоря о запрете на самостоятельное выполнение необратимых операций. «По сути, к нему надо относиться как к новому сотруднику или подрядчику, то есть держать на полном контроле», — заключил эксперт.

Синадский из УЦСБ же считает, что компании при внедрении ИИ-агента должна проводить аудит, составлять модель угроз и подбирать меры защиты. Также, по мнению эксперта, необходимо проектирование системы, учитывающей многоуровневую защиту всей ИИ-системы, которая будет включать такие решения, как внешние гардрейлы, регулярный редтиминг и kill-switch.

Директор департамента «Информационная безопасность» компании «Рексофт» Сергей Бабкин подчеркнул, что корпорациям и госкомпаниям важно принять и осознать риски, которые показали инциденты в Anthropic, а уже от этого и вырабатывать внутреннее решение об использовании ИИ-платформ для разработки кода. К этому Бабкин добавил, что некоторые заказчики уже запрещают использование ИИ-сервисов в своих проектах.

Ранее SecPost писал, что разработчики нейросетей вынуждены обрезать возможности своих продуктов из-за повышенного спроса хактивистов на ИИ для взлома. По статистике, применение нейросетей в кибератаках увеличилось на 93% в 2026 году. Тем не менее, эксперты заявили, что рост интереса со стороны злоумышленников вряд ли повлияет на темы развития нейросетей.