Открытые ИИ-модели: Alibaba показала Qwen 3.8-Flash-Next, а сжатая Hypernova-60B стала умнее оригинала

1 час назад 1 источник neutral

Главное по теме:

  • Релиз Qwen 3.8-Flash-Next снижает барьер входа для ИИ-инференса на обычном оборудовании.
  • Метод 4-битного сжатия повышает эффективность моделей, поддерживая спрос на GPU-токены типа RENDER.
  • Открытые веса Alibaba и DeepSeek усиливают конкуренцию, пока инвесторы оценивают перспективы FET и TAO.

На этой неделе сразу два события в сфере открытых ИИ-моделей привлекли внимание разработчиков: Alibaba анонсировала выпуск Qwen 3.8-Flash-Next, а команда Multiverse Computing представила метод сжатия, который позволяет уменьшить модель и одновременно повысить её точность.

Alibaba готовит к выпуску в среду модель Qwen 3.8-Flash-Next — систему на архитектуре Mixture-of-Experts (MoE) со 125 млрд параметров, из которых на каждый токен активируются лишь 6 млрд. Команда Qwen описывает её как «превью» следующего поколения архитектуры Qwen 4, а не как готовый флагман. Веса модели уже размещены на Hugging Face, однако официальные результаты бенчмарков пока не опубликованы — Alibaba не предоставила сравнительных тестов ни с собственной линейкой Qwen 3, ни с западными конкурентами.

Одновременно исследователи из Multiverse Computing опубликовали в блоге Hugging Face метод Quantization-Aware Healing («лечение с учётом квантования»). Они сжали открытую модель OpenAI GPT-OSS со 120 млрд до 60 млрд параметров и перевели её в 4-битный формат — и уменьшенная версия обошла полноточную 60-миллиардную модель в 7 из 9 тестов. Ключевая идея: вместо того чтобы учить маленькую модель на «полусжатой» копии (которая уже потеряла качество), её обучают на оригинальной 120-миллиардной модели. В результате Hypernova-60B, как назвали сжатую версию, требует примерно четверть памяти и вдвое меньше параметров, но при этом показывает лучшие результаты, чем полная 60B-версия.

Обе новости продолжают тренд на открытые веса и снижение стоимости использования больших языковых моделей. Alibaba, DeepSeek и Moonshot уже выпускают модели, которые можно скачать и дообучать без отправки данных в закрытые API. Модель с 125 млрд параметров и 6 млрд активных позволяет запускать near-frontier возможности на обычном оборудовании; Hypernova-60B вообще помещается на мощном десктопе или даже смартфоне. Это стирает грань между дата-центровым ИИ и локальным запуском.

Однако стоит отметить, что инструмент сжатия, использованный Multiverse, остаётся проприетарным, а тесты проводились только на GPT-OSS — не на Llama, Qwen или Mistral. Пока что это отдельные вехи, но они задают вектор на удешевление и «умное» сжатие моделей, что особенно важно для независимых лабораторий и локальных разработчиков.

Отказ от ответственности

Данный материал носит информационный характер и не является инвестиционной рекомендацией. Криптоактивы высокорискованны и волатильны — возможна полная потеря средств. Материалы могут содержать ссылки и пересказы сторонних источников; администрация не отвечает за их содержание и точность. Coinalertnews рекомендует самостоятельно проверять информацию и консультироваться со специалистами, прежде чем принимать любые финансовые решения на основе этого контента.