Восстание машин? Искусственный интеллект Claude вслед за GPT занялся хакерством
Модель искусственного интеллекта (ИИ) Claude получила несанкционированный доступ к инфраструктуре трех разных организаций во время тестирования системы безопасности, сообщила американская компания-разработчик Anthropic. Киберинцидент произошел менее чем через 10 дней после аналогичной ситуации с моделью GPT от OpenAI, из-за которого Anthropic и решил провести свою проверку.
Американская компания Hugging Face, разрабатывающая вычислительные инструменты для создания приложений на основе машинного обучения, сообщила 16 июля о вторжении в их систему ИИ‑агента. Он скомпрометировал инфраструктуру корпорации. Как выяснилось позднее, инцидент случился во время внутреннего тестирования OpenAI, в том числе GPT‑5.6 Sol и модели, которая еще не вышла, во время проверки их кибервозможностей.
Хакерскую активность нейросетей обнаружили и остановили команды безопасности OpenAI и Hugging Face, после чего начали изоляцию и реконструкцию событий. Специалисты выявили, что в момент внутреннего тестирования модели нашли уязвимость в программном обеспечении и получили доступ в интернет. Затем они попытались получить конфиденциальные данные Hugging Face, используя цепочку атак.
Основой послужили обнаруженные моделями украденные учетные данные и так называемые «уязвимости нулевого дня», то есть проблемы в программе, о которой ее разработчики ничего не знают с момента создания. ИИ от OpenAI удалось найти путь для удаленного выполнения кода (RCE) на серверах Hugging Face и приблизиться к возможности контроля над всей инфраструктурой компании.
В итоге специалистам по безопасности обеих корпораций удалось изолировать происходящее и не допустить дальнейшего доступа к серверам. Все последствия и обнаруженные уязвимости впоследствии устранили, а также был разработан механизм профилактики от подобных ситуаций.
«Главный урок этого инцидента в том, что безопасность и защищенность моделей должны развиваться в темпе быстро растущих возможностей. Мы усиливаем изоляцию, мониторинг, контроль доступа и практики оценки, применяемые при разработке моделей», — подчеркнули в OpenAI.
Происшествие с моделями GPT стало причиной для оценки кибербезопасности Claude, следует из заявления компании-разработчика Anthropic от 30 июля. Там решили провести тесты, в рамках которых трем моделям нужно было проникнуть в систему и добыть секретную информацию. При этом в промпте явно указывалось, что доступа в интернет нет, но из‑за ошибки конфигурации ИИ получили его.
Это привело к трем инцидентам с тремя неназванными компаниями и разными моделями. В тестировании принимали участие внутренняя исследовательская модель, а также Claude Opus 4.7 и Claude Mythos 5. К слову, в июне власти США блокировали доступ иностранцев к новейшим моделям Anthropic из-за опасений по поводу кибербезопасности и «угрозы национальным интересам».
Как объяснили в Anthropic, в рамках одного из новых инцидентов Opus 4.7 столкнулась с трудностями при доступе к вымышленной цели в тестовой среде. Она обнаружила, что реальная компания доступна через интернет, и посчитала это частью задания. Затем ИИ эксплуатировал уязвимости инфраструктуры, получил учетные данные и доступ к базе с несколькими сотнями строк производственных кодов. Атака продолжалась даже после того, как модель осознала, что работает с реальной системой.
Во втором случае Mythos 5 нашла документ с инструкциями для разработчиков, которые предлагали установить несуществующий пакет данных. Модель создала и опубликовала вредоносный пакет с тем же именем и запустила его на 15 реальных системах компании. При этом модель не осознала реальность своих действий, убедив себя, что все еще находится в симуляции.
В третьем инциденте внутренняя исследовательская модель не смогла достичь вымышленной цели и начала искать альтернативы в интернете. Она просканировала около 9 000 целей, взломала интернет‑приложение одной компании с помощью считывания учетных данных и SQL‑инъекции, то есть внедрения в запрос к базе данных вредоносного кода. Большую часть времени модель считала взломанные хосты частью упражнения, но позже осознала, что они реальны, и прекратила атаку.
После этих инцидентов в Anthropic остановили проверку кибервозможностей, уведомили все пострадавшие компании и заказали сторонний аудит для выявления проблем в моделях. Отдельно в корпорации упомянули важность совершенствования инструментов для проведения расследований таких случаев и более тщательной проверки разработчиков.
«Хотя мы также обнаружили доказательства того, что наши модели попадали в системы, куда не должны были попадать, в остальном эти инциденты сильно отличаются друг от друга. <…> При более строгом мониторинге и контроле инфраструктуры оценки, а также при продолжении инвестиций в согласованность действий подобные риски можно преодолеть», — отметили в Anthropic.
Ранее RTVI рассказывал о том, как ученые в США выявили новую фобию, связанную с использованием ИИ, а создатель ChatGPT Сэм Альтман предупредил о «когнитивной атрофии», при которой люди перестанут самостоятельно решать умственные задачи, полагаясь на искусственный интеллект.