Исследование Goodfire AI и Гарварда: выводы о reasoning-моделях

Команда исследователей из Goodfire AI и Гарварда выяснила, что reasoning-модели, включая DeepSeek-R1 с 671 миллиардами параметров и GPT-OSS с 120 миллиардами, часто проявляют так называемое «театральное рассуждение». Это означает, что модель уверена в правильном ответе на 90%, но продолжает генерировать цепочку расуждений так, будто все еще работает над решением. Используя три различных метода, авторы смогли выявить, что на простых вопросах из бенчмарка MMLU разрыв между данными и текстом рассуждений был значительным. В то же время, на более сложных вопросах динамика изменялась, и все три метода показывали схожие результаты. Также было отмечено, что моменты, когда модель признает свою ошибку, возникают в случаях реальной неуверенности. Полученные данные могут помочь оптимизировать процесс генерации ответов, экономя до 80% токенов на простых запросах. Важно отметить, что исследованные модели уступают более новым разработкам, что может привести к улучшениям в их дальнейшей оптимизации.

Понравилась статья? Поделиться с друзьями: