Команда Qwen от Alibaba Cloud анонсировала Qwen3.5-Omni — улучшенную мультимодальную модель, способную обрабатывать текст, изображения, аудио и видео. Она генерирует текст и речь в реальном времени и предлагается в трех вариантах: Plus, Flash и Light, доступных через Offline и Realtime API.
Ключевое отличие от предыдущей версии Qwen3-Omni заключается в увеличении контекстного окна с 32 до 256 тысяч токенов, что позволяет модели обрабатывать более 10 часов аудио или 400 секунд видео 720p за один запрос. Теперь распознавание речи охватывает 113 языков (против 19 ранее), а синтез — 36 языков (вместо 10).
По результатам бенчмарков версия Plus продемонстрировала выдающиеся результаты и превзошла Gemini 3.1 Pro в аудиопонимании и диалоге. Новые функции включают семантическое прерывание, клонирование голоса и управление эмоциями речи. Также появилась возможность Audio-Visual Vibe Coding, позволяющая писать код по видеоинструкциям без текстового промпта. Эта способность возникла как неожиданное свойство модели.