«Сырые и зарегулированные»: какие ИИ-модели используют хакеры, и есть ли среди них российские
Технический барьер для наступательных операций с использованием ИИ низок и продолжает снижаться, заявили аналитики Palo Alto, зафиксировавшие атаку китайского хакера с применением DeepSeek. Пока российский бизнес и регуляторы готовят нейросети к тестам на «духовно-нравственные ценности», пророссийские хакеры отмечают — отечественные модели используются злоумышленниками, но куда в меньшем объеме, чем зарубежные. SecPost узнал, какие нейросети в арсенале злоумышленников, как коммерческие решения эксплуатируются в злонамеренных целях, и как разработчики ИИ защищают свои наработки.
В конце июля китайского злоумышленника уличили в использовании LLM DeepSeek в оркестрации серии атак по цифровой инфраструктуре в Азии. Хакер использовал ручную и автоматизированную эксплуатацию — агент автономно провел поиск известных уязвимостей и выделил семь наиболее подходящих для атаки. Параллельно он задействовал Qwen, GLM, Kimi, MiniMax для проверки подключения и валидации прокси-серверов, также задействовав Codex от OpenAI для каталогов и разработки эксплойтов. Аналитики Palo Alto Networks, зафиксировавшие операцию, резюмировали: «Технический барьер для наступательных операций с использованием ИИ низок — и продолжает снижаться», — писал InfoSecurity Magazine.
Тем временем, в середине августа, «Яндекс» представил правительству концепцию набора тестовых и эталонных заданий для проверки соответствия ИИ духовно-нравственным ценностям. Об этом писал «Коммерсант» со ссылкой на источник в Минцифре.
SecPost опросил специалистов по ИБ и представителей хакерского сообщества, чтобы выяснить, как и какие модели используются злоумышленниками для организации атак.
«Используется все, что есть»: какие модели используют хакеры
Атакующая сторона выбирает модели так же, как и любой другой пользователь, отмечают опрошенные SecPost эксперты. Ключевыми факторами становятся доступность, дешевизна и наличие приемлемых результатов работы, отмечает руководитель направления развития продуктов кибербезопасности Cloud.ru Максим Долгинин. «Обычно атакующие используют модели, доступные в открытых источниках, такие как Hugging Face или ModelScope», — говорит эксперт.
«Используется все, что есть», — отмечает автор Telegram-канала «Топ кибербезопасности» Денис Батранков. Он приводит в качестве примера нашумевшую атаку LameHug, при которой использовалась модель Qwen 2.5-Coder-32B-Instruct. Точно так же используются и популярные коммерческие и открытые ИИ, такие как Deepseek, ChatGPT, Claude, Grok.
Руководитель отдела анализа сетевого трафика и машинного обучения департамента MXDR компании F6 Антон Афонин подчеркивает: точной статистики по использованию моделей злоумышленниками нет.
«Однако разработчики ИИ-сервисов, такие как OpenAI, Anthropic и Google, периодически выпускают отчёты, в которых рассказывают о выявленных случаях злоупотреблений. Из них видно, что популярные облачные модели, такие как GPT, Claude и Gemini, используются группировками на разных этапах атак», — говорит Афонин. Эксперт также отмечает, что большая часть работы в ходе атаки мало отличается от обычных пользовательских задач, чем пользуются злоумышленники.
«Нередко в одной операции они задействуют сразу несколько сервисов: один — для проведения разведки, другой — для перевода, третий — для подготовки убедительных писем», — говорит Афонин.
При этом злоумышленники поднаторели и в обходе встроенных ограничений в нейросетях. По словам Батранкова, попытка генерации фишингового шаблона на русском или английском может не удаться. И в таком случае хакеры, например, могут делать запросы на марокканском диалекте арабского языка или даже на казахском языке. «Это часто приводит к успешному обходу фильтров и генерации вредоносных инструкций и текстов», — отмечает эксперт.
Другой способ использования хакерами ИИ — так называемые DarkLLM, вроде того же WormGPT. По словам Батранкова, это по сути «обертки» (wrappers), благодаря которым хакеры могут обходить встроенные в системы фильтры безопасности. Долгинин приводит список таких моделей — помимо WormGPT существуют также FraudGPT, GhostGPT и десятки клонов, продающиеся на теневых форумах и в Telegram по подписке. «Это результат „умелой адаптации существующих LLM“ через манипуляции промптом и, в отдельных случаях, дообучение на нелегитимных данных — то есть обёртки над Grok, Mixtral и другими массовыми моделями, а не независимая разработка с нуля», — подчеркивает Долгинин.
Взлом и переделка: как хакеры адаптируют модели под собственные нужды
Современные модели, доступные через API, имеют разный уровень защиты от исполнения вредоносных инструкций, — говорит руководитель группы исследования технологий машинного обучения «Лаборатории Касперского» Владислав Тушканов. Используются ограничения, встроенные в модель в процессе обучения (alignment, или выравнивание), мониторинг внутренних состояний модели, внешнее решение для анализа запросов класса LLM Firewall и даже проактивный поиск подозрительных пользователей на основе анализа историй переписки. Защищенность сильно разнится.
«Каким-то моделям достаточно просто сказать, что ты проводишь санкционированный аудит безопасности, чтобы получить ответ на любой интересующий злоумышленника вопрос, другие же сервисы могут отозвать доступ к аккаунту на базе ретроспективного анализа подозрительной активности и не разрешают любые диалоги на тему кибербезопасности без верификации пользователя по паспорту», — подчеркивает Тушканов.
Среди других возможных мер, используемых разработчиками ИИ для усиления безопасности моделей, эксперты приводят Red Teaming, внедрение систем аномалий в облачные системы для выявления хакеров, Machine Unlearning, при котором модель заставляют «забыть» хакерские техники по созданию эксплойтов, и Guardrails.
В 2026 году Cloud.ru опубликовали в открытом доступе собственный Guardrails Filter — инструмент защиты чувствительных данных при работе с LLM. Он не привязан к конкретной платформе и может разворачиваться на собственной инфраструктуре компаний с любыми моделями, — рассказал SecPost Долгинин. Он также отмечает, что в случае, если компания разворачивает собственную модель, то необходимо внедрение дополнительных механизмов защиты — мониторинга и корреляции на уровне SOC в отношении инфраструктуры LLM, принцип наименьших привилегий для агентов и управление версиями весов.
«Владельцам ИИ-сервисов стоит анализировать не столько содержание одного запроса, сколько всю историю действий пользователя: последовательность и тематику запросов, а также повторяющиеся попытки обхода ограничений», — считает Афонин из F6. При этом блокировки одного аккаунта мало — часто злоумышленники используют несколько учетных записей.
Как отмечает Тушканов, доступы к моделям сами по себе могут быть целью злоумышленников: платные аккаунты в продвинутых сервисах могут заинтересовать хакеров. Такие учетные записи могут использоваться в злонамеренных целях или перепродаваться. По словам Тушканова, эксперты «Лаборатории Касперского» не раз обнаруживали объявления о продаже взломанных аккаунтов к ИИ-сервисам на черном рынке.
Эксперты отмечают: хакеры редко дообучают собственные модели, и когда это происходит, чаще это касается открытых моделей. Чаще происходит обход ограничений посредством джейлбрейка — гораздо проще и быстрее взять готовую мощную модель и обойти её защитные фильтры через специальный системный промпт. Когда хакеры самостоятельно адаптируют модели, результаты банально не всегда оправдывают затраты.
«Важно — не какая модель, а то, насколько легко её адаптировать»: используют ли хакеры отечественные модели
SecPost обратился в пресс-службу «Сбера» и «Яндекса» — ключевых отечественных компаний, занимающихся разработкой ИИ (продукты «Alice AI», GigaChat), — чтобы узнать, как они защищают собственные модели от использования хакерами. Ответ на запрос не поступил.
«Многие хакеры сегодня вполне довольствуются флагманскими нейросетями вроде ChatGPT», — отметил в комментарии SecPost пророссийский хакер PalachPro. Этих возможностей хватает для написания кода, анализа логов и решения рутинных задач.
«Но качественного отечественного ИИ, который бы официально существовал и при этом не уступал западным аналогам, я лично не встречал. Всё, что видел на рынке, либо сырое, либо излишне зарегулированное и цензурированное, поэтому для серьёзной работы оно не годится», — отметил собеседник редакции.
Представитель пророссийской группировки Z-Pentest отметил, что, «российские ИИ-модели, скорее всего, тоже используются в кибератаках — но их доля пока сравнительно невелика». Эти модели можно использовать для генерации и доработки кода, автоматизации отдельных задач и подготовки текстов. Однако по наблюдениям хакера, основная часть злоумышленников скорее ориентируется на западные модели. Собеседник также отмечает, что чаще речь идет не об официальном доступе к коммерческим сервисам, а о взломанных или модифицированных версиях моделей со снятыми ограничениями (по аналогии с вышеупомянутыми WormGPT).
«Сегодня важен не столько вопрос, какая именно модель используется, сколько то, насколько легко ее адаптировать под задачи злоумышленника. Открытые и взломанные версии популярных западных моделей дают атакующим гораздо больше возможностей и фактически становятся отдельным инструментом в их арсенале», — говорит представитель Z-Pentest.
Оба представителя пророссийского хакерского сообщества подтверждают распространенность адаптирования моделей под собственные задачи: ограничения убираются, идет доработка под нужные сценарии, машина «затачивается» под генерацию эксплойтов и проектирование DDoS-атак. PalachPro утверждает, что разработал «созданный с нуля ИИ» — многослойную систему агентов, каждый из которых отвечает под собственные задачи.
Оба собеседника скептично относятся к методам ограничения использования ИИ в атакующих целях — «на каждый хитрый болт найдется гайка с левой резьбой», говорит представитель Z-Pentest.
«Как только модель перестаёт принимать старый вариант джейлбрейка, люди пишут новый, и так по кругу. Остановить этот процесс невозможно, потому что он лежит в самой природе противостояния систем и человеческой изобретательности. Каждый патч рождает новый взлом, и так будет всегда», — подчеркивает PalachPro.

