На этой неделе сразу два события в сфере открытых ИИ-моделей привлекли внимание разработчиков: Alibaba анонсировала выпуск Qwen 3.8-Flash-Next, а команда Multiverse Computing представила метод сжатия, который позволяет уменьшить модель и одновременно повысить её точность.
Alibaba готовит к выпуску в среду модель Qwen 3.8-Flash-Next — систему на архитектуре Mixture-of-Experts (MoE) со 125 млрд параметров, из которых на каждый токен активируются лишь 6 млрд. Команда Qwen описывает её как «превью» следующего поколения архитектуры Qwen 4, а не как готовый флагман. Веса модели уже размещены на Hugging Face, однако официальные результаты бенчмарков пока не опубликованы — Alibaba не предоставила сравнительных тестов ни с собственной линейкой Qwen 3, ни с западными конкурентами.
Одновременно исследователи из Multiverse Computing опубликовали в блоге Hugging Face метод Quantization-Aware Healing («лечение с учётом квантования»). Они сжали открытую модель OpenAI GPT-OSS со 120 млрд до 60 млрд параметров и перевели её в 4-битный формат — и уменьшенная версия обошла полноточную 60-миллиардную модель в 7 из 9 тестов. Ключевая идея: вместо того чтобы учить маленькую модель на «полусжатой» копии (которая уже потеряла качество), её обучают на оригинальной 120-миллиардной модели. В результате Hypernova-60B, как назвали сжатую версию, требует примерно четверть памяти и вдвое меньше параметров, но при этом показывает лучшие результаты, чем полная 60B-версия.
Обе новости продолжают тренд на открытые веса и снижение стоимости использования больших языковых моделей. Alibaba, DeepSeek и Moonshot уже выпускают модели, которые можно скачать и дообучать без отправки данных в закрытые API. Модель с 125 млрд параметров и 6 млрд активных позволяет запускать near-frontier возможности на обычном оборудовании; Hypernova-60B вообще помещается на мощном десктопе или даже смартфоне. Это стирает грань между дата-центровым ИИ и локальным запуском.
Однако стоит отметить, что инструмент сжатия, использованный Multiverse, остаётся проприетарным, а тесты проводились только на GPT-OSS — не на Llama, Qwen или Mistral. Пока что это отдельные вехи, но они задают вектор на удешевление и «умное» сжатие моделей, что особенно важно для независимых лабораторий и локальных разработчиков.