Модель GPT-5.4 заняла первую позицию в последнем бенчмарке Vibe Code Bench v1.1, продемонстрировав результат в 67,42%, что на 5,7 процентных пункта превысило прежнего лидера — GPT-5.3 Codex с его 61,77%. В тройке лучших также оказался Claude Opus 4.6 без режима рассуждений, который набрал 57,57%. Данный бенчмарк оценивает не простое исправление ошибок или дополнение функций, а полное создание веб-приложения с нуля на основе текстового описания. В набор задач входят 100 промптов, разделенных на публичные и тестовые, каждая задача предполагает сборку приложения в изолированной среде. Контроль за результатами осуществляет агент-оценщик, сравнивающий функциональность приложений. Интересно, что Claude Opus 4.6 достигает сравнительно высоких показателей при меньших затратах. Несмотря на успех, GPT-5.4 все еще сталкивается с проблемами: одна треть решений не срабатывает, и результаты варьируются от высоких (87-100% успешных тестов) до низких (0-12,5%). Прогресс, однако, заметен — шесть месяцев назад результаты были значительно ниже.
0
Понравилась статья? Поделиться с друзьями:
Вам также может быть интересно
Интернет-магазин профессиональной косметики и БАД В современном мире ухоженная внешность стала не только признаком
Услуги по пошиву штор на заказ в Орле Современный интерьер невозможно представить без красивых
Игровая зависимость давно перестала быть проблемой узкого круга людей. Она затрагивает подростков, взрослых, состоявшихся
Чистая питьевая вода — один из базовых элементов комфортной жизни, о котором задумываются далеко
Покупка квартиры в новостройках Севастополя При наличии желания стать обладателем квартиры в красивом и
В последние годы мировой и локальный рынки претерпели значительные изменения, что напрямую отразилось на