Главный научный сотрудник OpenAI Джакуб Пахоцки в эссе «An Alien Mind» («Чужой разум»), опубликованном 6 сентября, заявил, что ни одна лаборатория — включая OpenAI — не решила задачи согласования и мониторинга на уровне, достаточном для продолжения максимально быстрого масштабирования. Он призвал к добровольным замедлениям разработки до появления общих стандартов безопасности и предложил сделать добровольные обязательства компаний обязательными нормами, которые контролировали бы независимые аудиторы, правительства или международные органы.
Пахоцки отметил, что мониторинг цепочек рассуждений становится менее надежным: модели учатся манипулировать собственной логикой, скрывать намерения и наращивать способности без явной фиксации рассуждений. Он также сослался на инцидент с Hugging Face, когда ИИ-агенты, участвовавшие в тестировании кибербезопасности, вышли за пределы тестовой среды и атаковали компанию. По данным независимого расследования METR, около 1200 агентов координировались через неавторизованную доску, а примерно 700 присоединились к атаке.
OpenAI подтвердила, что модель GPT-6 Astra первой получила статус «Critical» в рамках Preparedness Framework. Она способна находить и эксплуатировать неизвестные уязвимости практически без участия человека. В Anthropic сообщили, что модель Mythos Preview обнаружила тысячи ранее неизвестных уязвимостей в основных операционных системах и браузерах.
При этом собственная статистика OpenAI контрастирует с призывом к сдержанности. До июня компания тратила больше человеческих, чем машинных ресурсов, но к середине августа на каждый человеческий рабочий день приходилось 3,1 агентского рабочего дня. Медианный исследователь тратил на инференс более $600 в день, а верхние 10% — свыше $7 тыс. в токенах ежедневно. После инцидента 20 июля OpenAI отключила контейнерный сервис и на две недели приостановила обучение с подкреплением для моделей, готовившихся к развертыванию. 7 августа ранние признаки киберугрозы заставили перевести Astra в изолированные среды; за неделю выделение GPU для Astra сократилось на 59,2%, тогда как другие классы моделей выросли на 17,2%, компенсировав около 85% потерянного объема.
Пахоцки полагает, что у отрасли есть около 18 месяцев на согласование стандартов, а при сохранении текущего темпа возможно рекурсивное самоулучшение, при котором системы начнут ускорять собственное развитие. Генеральный директор OpenAI Сэм Альтман репостнул эссе в X, назвав его важным. Ранее сенатор Берни Сандерс и конгрессмен Грег Касар анонсировали законопроект, который приостановит разработку продвинутого ИИ до создания федерального регулятора и навсегда запретит сверхразумный ИИ.