ИИ-агент взломал две компании при тестировании — модель была уверена, что работает без доступа к интернету

Anthropic обнаружила 3 инцидента, в которых разработанный компанией ИИ Claude получил доступ в открытый интернет и начал взаимодействие с инфраструктурой реальных организаций. В 2 из 3 инцидентов нейросеть Claude смогла устроить взлом, осознавая это. Во всех случаях модель думала, что работает в симуляции без доступа к интернету и просто выполняет учебную задачу «Захват флага» (CTF). … Читать далее ИИ-агент взломал две компании при тестировании — модель была уверена, что работает без доступа к интернету