Новый закон уплотнения для языковых моделей: рост плотности способностей

Недавнее исследование в журнале Nature Machine Intelligence вводит концепцию «плотности способностей» для больших языковых моделей (LLM). Эта метрика демонстрирует, что максимальная плотность способностей удваивается примерно каждые 3,5 месяца, что позволяет извлекать больше качества из каждого параметра модели. Анализ на нескольких бенчмарках, таких как MMLU и HumanEval, подтверждает устойчивый экспоненциальный рост плотности, что указывает на необходимость перехода к более эффективным методам обучения. Обнаружено, что при фиксированном качестве количество необходимых параметров значительно снижается, что ведет к удешевлению токенов. Это сочетание с законом Мура предполагает, что мощные модели могут работать локально на потребительском оборудовании, что ставит под сомнение традиционный подход к масштабированию. В результате, фокус смещается к обучению на основе плотности, что подчеркивает важность архитектурных и оптимизационных улучшений.

Понравилась статья? Поделиться с друзьями: