В мире нейросетей новые бенчмарки появляются каждую неделю. Среди них GPQA Diamond, Lexometrica, LLM Persuasion Benchmark и Chatbot Arena, каждый проверяет разные аспекты AI. Однако возникает вопрос: зачем нужен еще один тест? Ответ — перекрёстное подтверждение. Например, GPT-5.4 занимает топовые позиции во всех перечисленных тестах, в то время как Kimi K2.5 остаётся в середине. Российские модели, такие как YandexGPT и GigaChat, оказались на дне списка.
В исследовании были протестированы 54 модели по 32 сценариям. У колен модель Claude Sonnet показала высокие результаты в управлении проектами, несмотря на низкие баллы в других тестах. Однако главной проблемой российских AI стало отсутствие чётких систематических бенчмарков для оценки в условиях равных конкуренции с международными аналогами.
Китайские модели, такие как MiniMax, предлагают стабильные результаты и бесплатный доступ. Они всё ближе к мировым лидерам по качеству. Разница в подходах к заданиям и структуре промптов определяет степени успешности. Важно освоить формулирование задач для AI, чтобы извлечь наилучшие результаты от используемой модели.