Команда исследователей из Goodfire AI и Гарварда выяснила, что reasoning-модели, включая DeepSeek-R1 с 671 миллиардами параметров и GPT-OSS с 120 миллиардами, часто проявляют так называемое «театральное рассуждение». Это означает, что модель уверена в правильном ответе на 90%, но продолжает генерировать цепочку расуждений так, будто все еще работает над решением. Используя три различных метода, авторы смогли выявить, что на простых вопросах из бенчмарка MMLU разрыв между данными и текстом рассуждений был значительным. В то же время, на более сложных вопросах динамика изменялась, и все три метода показывали схожие результаты. Также было отмечено, что моменты, когда модель признает свою ошибку, возникают в случаях реальной неуверенности. Полученные данные могут помочь оптимизировать процесс генерации ответов, экономя до 80% токенов на простых запросах. Важно отметить, что исследованные модели уступают более новым разработкам, что может привести к улучшениям в их дальнейшей оптимизации.
0
Понравилась статья? Поделиться с друзьями:
Вам также может быть интересно
Интернет-магазин профессиональной косметики и БАД В современном мире ухоженная внешность стала не только признаком
Услуги по пошиву штор на заказ в Орле Современный интерьер невозможно представить без красивых
Игровая зависимость давно перестала быть проблемой узкого круга людей. Она затрагивает подростков, взрослых, состоявшихся
Чистая питьевая вода — один из базовых элементов комфортной жизни, о котором задумываются далеко
Покупка квартиры в новостройках Севастополя При наличии желания стать обладателем квартиры в красивом и
В последние годы мировой и локальный рынки претерпели значительные изменения, что напрямую отразилось на