Разное Февраль 28, 2026
Обучение крупных языковых моделей традиционно считается гонкой за вычислительными ресурсами. Однако новое исследование показывает, что серьёзный прирост производительности можно получить не за счёт наращивания GPU-кластеров, а за счёт более эффективного использования уже доступного «железа».
Команда исследователей из MIT совместно с партнёрами, включая NVIDIA, предложила метод, позволяющий сократить время обучения моделей почти вдвое без потери качества.
Ключевая проблема находится в обучении с подкреплением, а именно на этапе rollout. В этой фазе модель генерирует множество вариантов ответов, чтобы определить, какие действия приводят к лучшему результату. Для LLM, ориентированных на рассуждения, это обязательный этап, но именно он часто становится главным тормозом.
Rollout может занимать до 85% общего времени обучения. Причина — «длиннохвостое» распределение длин ответов: большинство генераций завершается быстро, но небольшая часть занимает значительно больше времени. Из-за необходимости синхронизации GPU быстрые устройства простаивают, ожидая завершения самых долгих вычислений.
Предложенное решение получило название Taming the Long Tail (TLT). Его идея заключается в том, чтобы использовать простаивающее время GPU не впустую. Пока часть ускорителей ждёт окончания длинных генераций, они дообучают лёгкую черновую (draft) модель прямо в процессе тренировки.
Эта черновая модель используется для спекулятивного декодирования, предсказывая токены заранее и позволяя основной модели проверять их пакетно. В отличие от классического подхода, где вспомогательная модель фиксирована и быстро устаревает, в TLT она постоянно обновляется и остаётся синхронизированной с основной моделью. При этом не требуется выделять дополнительные вычислительные ресурсы.
Эксперименты на нескольких reasoning-ориентированных LLM и реальных датасетах показали ускорение полного цикла обучения на 70–210% по сравнению с сильными базовыми решениями. Во многих сценариях это означает фактическое удвоение скорости обучения без ухудшения точности.
Дополнительный бонус — сама черновая модель. Поскольку она обучается параллельно с основной, её можно использовать как эффективную модель для инференса в задачах, где важна скорость.
Работа хорошо вписывается в общий тренд индустрии ИИ: переход от грубого наращивания вычислений к более тонкой оптимизации. Если такие подходы, как TLT, подтвердят свою устойчивость на промышленных масштабах, они смогут существенно снизить как финансовые, так и энергетические затраты на обучение моделей следующего поколения.
Иногда самый быстрый способ двигаться вперёд — перестать тратить время впустую.