GPT-5.4 обогнал соперников в Vibe Code Bench

Модель GPT-5.4 заняла первую позицию в последнем бенчмарке Vibe Code Bench v1.1, продемонстрировав результат в 67,42%, что на 5,7 процентных пункта превысило прежнего лидера — GPT-5.3 Codex с его 61,77%. В тройке лучших также оказался Claude Opus 4.6 без режима рассуждений, который набрал 57,57%. Данный бенчмарк оценивает не простое исправление ошибок или дополнение функций, а полное создание веб-приложения с нуля на основе текстового описания. В набор задач входят 100 промптов, разделенных на публичные и тестовые, каждая задача предполагает сборку приложения в изолированной среде. Контроль за результатами осуществляет агент-оценщик, сравнивающий функциональность приложений. Интересно, что Claude Opus 4.6 достигает сравнительно высоких показателей при меньших затратах. Несмотря на успех, GPT-5.4 все еще сталкивается с проблемами: одна треть решений не срабатывает, и результаты варьируются от высоких (87-100% успешных тестов) до низких (0-12,5%). Прогресс, однако, заметен — шесть месяцев назад результаты были значительно ниже.

Понравилась статья? Поделиться с друзьями: