Как сократить расходы на обучение ИИ на 80%? Новый оптимизатор Оксфорда обеспечивает в 7.5 раз более быстрое обучение, оптимизируя процесс обучения модели
Скрытые расходы на ИИ: счет за GPU
Обучение моделей ИИ обычно обходится в миллионы долларов на вычисления с использованием GPU. Это бремя формирует бюджеты, ограничивает эксперименты и замедляет прогресс. Обучение современной языковой модели или трансформера на ImageNet-1K может потребовать тысячи часов работы GPU, что делает это экономически нецелесообразным для стартапов, лабораторий или даже крупных технологических компаний. Однако изменение в оптимизаторе может потенциально снизить эти расходы на GPU до 87%.
Недостатки традиционного подхода к обучению моделей
Современное глубокое обучение опирается на метод градиентного спуска, где оптимизатор корректирует параметры модели для уменьшения потерь. В процессе масштабного обучения используются мини-пакеты — подмножества обучающих данных, усредняющие свои градиенты для получения одного направления обновления. Проблема заключается в том, что градиенты каждого элемента в пакете различаются, и стандартный подход считает эти различия случайным шумом. На самом деле, этот «шум» предоставляет важные сигналы о ландшафте потерь.
FOP: Навигатор, учитывающий рельеф
Fisher-Orthogonal Projection (FOP) рассматривает вариацию между градиентами в пакете не как шум, а как карту местности. Он усредняет градиент и проецирует различия, создавая компонент, чувствительный к кривизне, который направляет оптимизатор, избегая препятствий и следуя оптимальному пути. Это улучшает стабильность и скорость сходимости.
Как это работает:
- Средний градиент указывает направление.
- Различие градиентов действует как датчик местности, показывая, плоский или крутой ландшафт.
- FOP комбинирует оба сигнала, добавляя шаг, учитывающий кривизну, перпендикулярный основному направлению.
Это приводит к более быстрой и стабильной сходимости, даже при экстремальных размерах пакетов, где традиционные методы сталкиваются с трудностями.
FOP на практике: в 7.5 раз быстрее на ImageNet-1K
Результаты впечатляют:
- ImageNet-1K (ResNet-50): Для достижения стандартной валидационной точности (75.9%) SGD требует 71 эпоху и 2,511 минут, в то время как FOP достигает той же точности всего за 40 эпох и 335 минут — что приводит к ускорению в 7.5 раз.
- CIFAR-10: FOP в 1.7 раз быстрее, чем AdamW, и в 1.3 раза быстрее, чем KFAC. При максимальном размере пакета (50,000) только FOP достигает 91% точности, другие методы терпят неудачу.
- ImageNet-100 (Vision Transformer): FOP в 10 раз быстрее, чем AdamW, и в 2 раза быстрее, чем KFAC при больших размерах пакетов.
- Долгие наборы данных: FOP снижает ошибку Top-1 на 2.3–3.3% по сравнению с сильными базовыми линиями.
- Масштабируемость: FOP сохраняет сходимость даже при размерах пакетов в десятки тысяч, в отличие от существующих методов, которые теряют эффективность.
Почему это важно для бизнеса, практики и исследований
Для бизнеса сокращение расходов на обучение на 87% меняет экономику разработки ИИ. Команды могут реинвестировать сэкономленные средства в более крупные модели или более быстрые эксперименты.
Для практиков FOP легко реализовать с помощью открытого кода, который можно интегрировать в существующие рабочие процессы PyTorch с минимальными изменениями.
Для исследователей FOP переопределяет понятие «шума» в градиентном спуске, подчеркивая важность внутрипакетной вариации для реальных приложений.
Как FOP меняет ландшафт
Традиционно большие пакеты вызывали проблемы, приводя к нестабильности оптимизаторов. FOP использует вариации градиентов внутри пакета, что позволяет обеспечить стабильное и эффективное обучение на беспрецедентных масштабах, что является значительным сдвигом в стратегиях оптимизации.
Итог
Fisher-Orthogonal Projection (FOP) представляет собой значительное достижение в области обучения ИИ на большом масштабе, обеспечивая до 7.5× более быструю сходимость на наборах данных, таких как ImageNet-1K, при этом улучшая обобщение и снижая уровни ошибок на сложных данных. Используя и сохраняя вариацию градиентов, FOP оптимизирует процесс обучения, что приводит к значительным сокращениям затрат и позволяет исследователям и компаниям быстрее внедрять инновации. Его простая реализация в PyTorch делает его практическим решением для будущего машинного обучения.
















