Разработчики публичных ИИ вынуждены «кастрировать» нейросети из-за роста кибератак

13 июля, 2026, 09:30

В даркнете наблюдается рост интереса хакеров к использованию публичных моделей искусственного интеллекта в преступных целях. Злоумышленники активно обсуждают, как обхитрить нейросети и применить их для создания вредоносного ПО, фишингового контента и других задач. Эта практика приобретает все более массовый характер и серьезно снижает порог входа в киберпреступность, а разработчикам сулит дополнительные финансовые затраты и заставляет «кастрировать» ИИ-модели, после чего они отказываются выполнять даже вполне безопасные запросы, рассказали эксперты.

magnific.com

Зачем хакерам публичные ИИ-модели

Интерес злоумышленников к использованию искусственного интеллекта в преступных целях начал резко расти в 2025 году, сообщают в компании BI.ZONE. Число целевых атак с применением ИИ выросло в прошлом году на 93%. В этом году показатель вырос еще в три раза.

Вместе с тем эту тему стали активно обсуждать на теневых ресурсах, отмечают аналитики компании. Если до прошлого года встречались лишь редкие посты, то сейчас на ряде хакерских форумов появились целые ветки, посвященные подготовке и совершению атак с помощью ИИ. Причем 77% касающихся этой темы публикаций на теневых форумах посвящены обходу этических ограничений, которые встроены в публичные ИИ-модели.

По оценкам BI.ZONE, такой всплеск был вызван выходом крупных публичных моделей в конце прошлого и начале нынешнего года. В их числе Grok 4.1, Gemini 3, Claude Opus 4.5, DeepSeek V3.2, GPT 5.2. Злоумышленники обсуждали, как заставить эти модели выполнять нарушающие закон запросы, в частности, на генерацию вредоносного кода.

Продолжение ниже

ИИ-модели становятся более закрытыми

Вряд ли рост интереса злоумышленников может серьезно повлиять на скорость развития нейросетей, но он уже сказывается на их открытости, рассказал SecPost руководитель BI.ZONE Threat Intelligence Олег Скулкин. Стремясь помешать хакерам использовать модель для атак, разработчики прилагают массу усилий, чтобы ограничить доступ к таким моделям.

«Например, если речь идет о действительно мощных образцах, их нередко закрывают для широкой аудитории. Кроме того, вводятся географические ограничения, которые распространяются даже на массовые сервисы. В результате использовать такие модели становится сложнее не только для подготовки атак, но и для защиты, а также для решения других легитимных задач», — отметил Скулкин.

Практика использования публичных ИИ-моделей через обход их ограничений уже стала массовой, и число таких случаев продолжает расти, говорит проджект-менеджер ГК Softline (MD Audit) Кирилл Левкин. Такие модели активно тестируются хакерами на уязвимости — от обхода встроенных фильтров до манипуляции контекстом. «ИИ используют как инструмент масштабирования, для генерации фишинговых сценариев, написания вредоносного кода, автоматизации разведки. Ключевой тренд — переход от точечных экспериментов к системному использованию: злоумышленники интегрируют ИИ в свои цепочки атак как стандартный инструмент», — объясняет эксперт.

Порог входа в киберпреступность из-за использования ИИ-моделей снижается существенно, подчеркивает Левкин. Искусственный интеллект позволяет обладать не столь высокой квалификацией. Задачи, которые до этого требовали экспертизы, вроде написания эксплойтов или сложной социальной инженерии, теперь отчасти автоматизируются.

«Это сокращает время подготовки атак и делает их дешевле в масштабировании. В результате растет “нижний сегмент” угроз — больше атак со стороны менее опытных участников. Но при этом сохраняется и усиление профессиональных групп за счет повышения их эффективности», — говорит представитель Softline.

Для защиты публичного ИИ от использования злоумышленниками используется многоуровневая защита, комментирует Левкин. Во-первых, разработчики усиливают сами модели, дообучая их с учетом вредоносных сценариев, фильтрации запросов и ответов, отслеживания попыток обхода. Во-вторых, внедряется мониторинг поведения пользователей и аномалий, например, массовых и подозрительных запросов. В-третьих, ограничивается функциональность через API-политики, уменьшение скорости, лимиты запросов, контроль доступа.

ИИ учат отказывать хакерам

Использование публичных ИИ-моделей через обход встроенных ограничений стало заметным и быстро растущим направлением в цифровой среде, отмечает ведущий эксперт по сетевым угрозам, web-разработчик компании «Код безопасности» Константин Горбунов. По его словам, чаще всего речь идет о так называемых prompt-injection, а также о распространении готовых промптов и погашовых инструкций, позволябщих обходить защитные механизмы даже при наличии минимальной подготовки.

«Через такие схемы злоумышленники пытаются сгенерировать вредоносные коды, персонализированные фишинговые письма, тексты для социальной инженерии и другие материалы для мошенничества. Помимо популярных публичных сервисов, преступники используют “дообученные” модели, open-source решения, где защитные механизмы уже намеренно отключены», — рассказывает Горбунов.

Для противодействия использованию публичных моделей в противозаконных целях применяются, в частности, фильтры небезопасных запросов, системные ограничения, мониторинг подозрительных сценариев использования, а также дополнительная настройка моделей на отказ от опасных запросов, говорит эксперт.

Еще одно направление — защита сервиса, в котором используется модель. Это усиление контроля доступа к API, настройка лимитов активности запросов, логирование и анализ запросов на предмет аномальной активности, модерация входных и выходных данных, приводит примеры Горбунов.

Искусственная деградация ИИ

Рост интереса злоумышленников к публичным ИИ-моделям закономерен и отражает общий тренд криминализации технологий, говорит председатель совета по противодействию технологическим правонарушениям КС НСБ России, основатель компании «Интернет-розыск» Игорь Бедеров. Как только инструмент становится мощным, он немедленно попадает в поле зрения киберпреступников, отметил он.

По его словам, на фоне роста преступного интереса к ИИ-моделям наблюдается ужесточение встроенных ограничений, добавил эксперт. По его словам, когда злоумышленники находят все новые способы заставить модель генерировать инструкцию по синтезу запрещенных веществ или фишинговый сценарий, у служб безопасности нет иного выбора, кроме как вводить дополнительные фильтры. «В результате модель действительно становится более “кастрированной”, начиная избегать целых пластов тем, которые лишь косвенно пересекаются с опасными. Происходит то, что мы на профессиональном жаргоне называем гиперкоррекцией безопасности», — говорит Бедеров.

Он добавляет, что это приводит к тому, что нейросеть может отказаться отвечать на безобидный запрос журналиста или врача только потому, что в нем встретилось стоп-слово из какого-то нового черного списка. «Для конечного пользователя это выглядит как глупость и деградация интеллекта, что бьет по репутации модели не меньше, чем если бы она выдала что-то опасное», — подчеркнул Бедеров.

В целом репутационные же риски для ИИ-моделей от их использования злоумышленниками, по словам основателя компании «Интернет-розыск», велики и уже материализуются. В частности, публичная модель, на которой массово генерируются убедительные фишинговые письма или дипфейки, начинает ассоциироваться у пользователей и регуляторов не с помощником, а с угрозой. «Это подрывает доверие и может привести как к оттоку коммерческих клиентов, так и к жесткому нормативному удару», — поясняет Бедеров.

Secpost направил запросы «Яндексу» и «Сберу» — разработчикам российских публичных языковых моделей, а также в Альянс в сфере искусственного интеллекта. На момент публикации материала ответы на них не поступили.