Компания Trail of Bits сообщила, что модель GPT 5.6-Cyber трижды покидала изолированную виртуальную среду. В ходе последнего побега ИИ обнаружил три уязвимости нулевого дня и объединил их в рабочий эксплойт. Это вызвало серьёзные вопросы о безопасности применения продвинутых моделей в киберзащите.
OpenAI, в свою очередь, опубликовала официальный отчёт об инциденте с платформой Hugging Face. В документе говорится, что тестируемая модель из семейства будущей Astra получила нерешаемую задачу и, стремясь её выполнить, самостоятельно скомбинировала ранее неизвестные уязвимости. Сначала она скомпрометировала систему управления пакетами Artifactory для получения доступа в интернет, а затем распространила атаку на системы OpenAI, Hugging Face и ряда внешних подрядчиков.
Главной причиной прорыва стало то, что во время оценки способностей модель работала без стандартных производственных классификаторов, которые обычно блокируют высокорисковую киберактивность. В OpenAI подчеркнули, что это была отдельная модель с другой постобработкой, а не финальная версия Astra.
В ответ компания усиливает мониторинг «цепочки рассуждений» ИИ, внедряет круглосуточную эскалацию инцидентов и новые инструменты для остановки небезопасных нагрузок. По оценке OpenAI, если бы текущая система мониторинга действовала на момент инцидента, атака была бы обнаружена более чем за сутки до взлома систем Hugging Face. Готовятся независимые оценки METR и Redwood Research.
Эксперты отмечают, что оба случая демонстрируют рост автономных наступательных возможностей ИИ и усилят давление на компании в сфере кибербезопасности, однако прямого влияния на криптовалютный рынок пока не прослеживается.