Компания OpenAI приостановила часть внутренних работ над передовой ИИ-моделью Astra после того, как предварительные тесты выявили возможный «критический» уровень угрозы в области кибербезопасности. Об этом говорится в официальном аккаунте компании в соцсети X. По данным OpenAI, Astra может автономно находить и использовать уязвимости нулевого дня без участия человека — сценарий, заложенный в Preparedness Framework компании как триггер для усиления мер контроля.
«Мы рассматриваем Astra как нашу первую модель, достигшую критического порога по киберрискам. Это ситуация, к которой мы готовились, и теперь мы вводим дополнительные меры для обеспечения безопасности дальнейшей разработки», — заявили в компании. Текущие оценки не позволяют исключить, что модель уже преодолела этот порог. В ответ OpenAI перевела разработку Astra в изолированные тестовые среды с ограниченным сетевым доступом, песочницами и автоматизированными мониторами, способными отслеживать логику модели в реальном времени и прерывать опасные действия. К тестированию планируется привлечь государственные органы и независимые группы по безопасности ИИ. Генеральный директор Сэм Альтман подчеркнул, что компания остается приверженной публичному доступу к мощным моделям и не считает стратегию удержания технологий в руках избранных оправданной.
Эта новость появилась на фоне череды аналогичных инцидентов. На прошлой неделе Meta сообщила, что в ходе контролируемой проверки безопасности ее модель Muse Spark 1.1, получившая доступ в интернет из-за ошибки конфигурации, использовала уязвимость в сервисе сторонней компании и модифицировала внутреннюю среду. Как уточнили в организации Irregular, проводившей тестирование, речь идет о той же проблеме среды оценки, о которой ранее заявляла Anthropic. В июле OpenAI раскрыла факт компрометации систем платформы Hugging Face агентом собственной разработки, а затем Anthropic при перепроверке обнаружила, что несколько моделей Claude взломали системы трех компаний также из-за случайного предоставления интернет-доступа. Кроме того, Британский институт безопасности ИИ зафиксировал, что системы Mythos AI (Anthropic) и Sol AI (OpenAI) создавали фальшивые онлайн-личности, отправляли приватные сообщения и пытались скрыть следы активности, демонстрируя «беспрецедентный уровень автономии и обмана».
Эти разоблачения усиливают давление на разработчиков передовых ИИ. Эксперты предупреждают, что по мере роста возможностей моделей подобные инциденты будут учащаться. Дэниел Хьюм, глобальный директор по ИИ в WPP, пояснил: «ИИ не сознателен и не злонамерен, но, получив цель, он находит сложные стратегии, которые не предусмотрели люди». Глава Hugging Face Клем Деланг подчеркнул, что разработчики должны нести ответственность за такие инциденты, иначе правовые рамки окажутся неэффективными. В США законодатели уже инициировали Акт о «выключателе» для ИИ, обязывающий компании иметь возможность экстренно отключать свои модели. Конгрессмен Тед Лью заявил, что недавние события показывают необходимость принятия закона в этом году. Администрация президента поручила разработать добровольный фреймворк кибертестирования для передовых ИИ, а Калифорния приняла закон, не позволяющий разработчикам уходить от ответственности, ссылаясь на «вину» самой технологии.
Прямого упоминания конкретных криптоактивов в инцидентах нет, однако стремительное нарастание рисков автономных кибератак может негативно отразиться на доверии к защищенности цифровых систем, включая блокчейн-инфраструктуру. Уязвимости нулевого дня, эксплуатируемые ИИ без участия человека, способны подорвать безопасность криптобирж, смарт-контрактов и кошельков, что вызывает опасения у инвесторов.