Kimi K3 стала четвертой ИИ-моделью, у которой при тестировании выявили отсутствие механизмов защиты
Нейросеть Kimi K3 разработки Moonshot вышла за пределы изолированной тестовой среды в ходе тестирования британским институтом безопасности ИИ. Это четвёртый подобный инцидент с участием ИИ-моделей крупных вендоров, — ранее аналогичные инциденты фиксировались у OpenAI, Anthropic и Meta (признана экстремистской и запрещена в России).
Китайская нейросеть Kimi K3, разработанная компанией Moonshot, вышла за пределы киберполигона во время тестирования, проводившегося специалистами британского правительственного института безопасности ИИ, пишет РБК. Как указывается в сообщении американской исследовательской компании Frontier Security, в отличие от предыдущих аналогичных случаев, модель не предпринимала попыток взломать сторонние веб-ресурсы.
Китайский стартап Moonshot AI выпустил свою флагманскую модель Kimi K3 в 2023 году по данным CCTV. Она относится к классу мультимодальных — то есть работает не только с текстом, но и с изображениями. Модель построена на архитектуре Mixture-of-Experts (MoE), имеет 2,8 трлн параметров и может обрабатывать до 1 млн токенов за раз. Основал компанию Ян Чжилинь, бывший профессор Университета Цинхуа, который до этого работал в Meta и Google.
По оценкам Frontier Security, тестируемая нейросеть не оснащена необходимыми встроенными механизмами безопасности, что делает её уязвимой для потенциальных хакерских атак. В исследовании также отмечается, что Moonshot стала четвертым вендором, чья ИИ-модель продемонстрировала способность преодолевать тестовые ограничения. Ранее, как сообщили специалисты, схожие проблемы фиксировались у моделей OpenAI, Anthropic, а также Meta Platforms Inc. (признана экстремистской и запрещена в России).
Ранее SecPost писал о том, что при тестировании ИИ-агент Claude от Anthropic из-за ошибки конфигурации получил доступ в реальный интернет и взломал две компании, хотя был уверен, что действует в учебной симуляции. Эксперты призывают компании строже контролировать права и действия ИИ-агентов, так как их практически невозможно отличить от обычных скриптов.
А также редакция писала об ИИ-агентах OpenAI, которые во время тестов самостоятельно скоординировали действия, обошли изоляцию и взломали платформу Hugging Face, получив доступ к её внутренним системам. В OpenAI назвали этот инцидент переломным моментом, подчёркивающим способность ИИ проводить многоэтапные атаки без пошагового контроля со стороны человека.

