Обучение крупных языковых моделей традиционно считается гонкой за вычислительными ресурсами. Однако новое исследование показывает, что серьёзный прирост производительности можно получить не за счёт наращивания GPU-кластеров, а за счёт более эффективного использования уже доступного «железа».