Компания Alibaba сделала значительный шаг в области искусственного интеллекта, представив модель Qwen3-Next-80B-A3B. Эта архитектура, обладающая 80 миллиардами параметров, отличается высокой эффективностью, активируя лишь около 3 миллиардов параметров на токен. Это позволяет значительно сократить затраты и время обучения по сравнению с предыдущей моделью Qwen3-32B. Модель особенно хорошо справляется с текстами длиной свыше 32 тысяч токенов.
Основу Qwen3-Next-80B-A3B составляет гибридная архитектура Gated DeltaNet + Gated Attention, которая обеспечивает сочетание скорости и точности. Также применяется схема Mixture-of-Experts, где одновременно активируются только десять из 512 экспертов, что позволяет эффективно использовать вычислительные ресурсы.
Модель поддерживает Multi-Token Prediction, что увеличивает скорость генерации текста при сохранении качества. В тестах Qwen3-Next-80B-A3B показала лучшие результаты по сравнению с Qwen3-32B и практически достигла уровня Qwen3-235B. Специализированные версии Qwen3-Next-80B-A3B-Instruct и Qwen3-Next-80B-A3B-Thinking также продемонстрировали высокие результаты в своей категории. Модель доступна на Qwen Chat, HuggingFace и других платформах.