Китайский стартап DeepSeek анонсирует модель V4 с прорывными возможностями

Китайская компания DeepSeek анонсировала выход своей новой флагманской модели V4, который намечен на середину февраля, согласно информации от источников The Information. Внутренние тесты показали, что V4 превосходит Claude от Anthropic и серию GPT от OpenAI в области программирования, а также демонстрирует высокие результаты при работе с длинными промптами, что может значительно помочь разработчикам.

Тактика релиза повторяет прошлогодний запуск модели R1, который состоялся 20 января, за неделю до китайского Нового года. V4 планируется представить к 17 февраля, совпадая с началом праздничных каникул в Китае.

Новая модель отражает изменение стратегии DeepSeek: если R1 ориентировалась на теоретические аспекты, то V4 акцентирует внимание на прикладном инжиниринге. Компания нацелена на корпоративный сектор, где качество кода имеет непосредственное влияние на доходы.

В преддверии анонса DeepSeek расширила документацию по R1, добавив 60 страниц о процессе обучения и признала, что некоторые методы, такие как Monte Carlo Tree Search, не оправдали себя для общих задач.

Интересным остается вопрос о том, сохранит ли V4 формат открытых весов, что могло бы поставить под угрозу бизнес-модели закрытых лабораторий, представив бесплатную альтернативу более дорогим решениям.

Понравилась статья? Поделиться с друзьями: