На платформе Hugging Face была представлена новая коллекция моделей Qwen3-VL от Alibaba. В своем блоге компания продемонстрировала, что эти модели могут выполнять множество задач. Например, они отвечают на вопросы на 32 языках, а также способны обрабатывать изображения. Пользователи могут отправлять изображения и задавать вопросы о них, а также предоставлять рисунки и получать HTML-код для интерфейсов, изображенных на картинках. Модели распознают текст на сканированных страницах и могут объяснять математические и химические концепции.
Недавно я использовал модель GPT-OSS-120B, но перешел на Qwen3-VL-30B-A3B-Thinking-FP8, которая, хотя и уступает по некоторым параметрам, поддерживает работу с изображениями. Скорость генерации токенов у обеих моделей примерно одинакова.
Для запуска Qwen3-VL необходима мощная система с GPU NVIDIA RTX 4090D и установленными драйверами. В версии vllm 0.11.0 добавлена поддержка этой модели, но запуск возможен только с полным размещением на GPU. VLLM не предоставляет пользовательский интерфейс, но можно использовать API для взаимодействия. Модели показывают отличные результаты, обеспечивая высокое качество ответов.