Itinai.com user using ui app iphone15 closeup hands photo can a757815c 1405 470a 99ad 8da436e99421 0

Сократите расходы на обучение ИИ на 80% с новым оптимизатором Оксфорда

Itinai.com user using ui app iphone15 closeup hands photo can a757815c 1405 470a 99ad 8da436e99421 0

Как сократить расходы на обучение ИИ на 80%? Новый оптимизатор Оксфорда обеспечивает в 7.5 раз более быстрое обучение, оптимизируя процесс обучения модели

Скрытые расходы на ИИ: счет за GPU

Обучение моделей ИИ обычно обходится в миллионы долларов на вычисления с использованием GPU. Это бремя формирует бюджеты, ограничивает эксперименты и замедляет прогресс. Обучение современной языковой модели или трансформера на ImageNet-1K может потребовать тысячи часов работы GPU, что делает это экономически нецелесообразным для стартапов, лабораторий или даже крупных технологических компаний. Однако изменение в оптимизаторе может потенциально снизить эти расходы на GPU до 87%.

Недостатки традиционного подхода к обучению моделей

Современное глубокое обучение опирается на метод градиентного спуска, где оптимизатор корректирует параметры модели для уменьшения потерь. В процессе масштабного обучения используются мини-пакеты — подмножества обучающих данных, усредняющие свои градиенты для получения одного направления обновления. Проблема заключается в том, что градиенты каждого элемента в пакете различаются, и стандартный подход считает эти различия случайным шумом. На самом деле, этот «шум» предоставляет важные сигналы о ландшафте потерь.

FOP: Навигатор, учитывающий рельеф

Fisher-Orthogonal Projection (FOP) рассматривает вариацию между градиентами в пакете не как шум, а как карту местности. Он усредняет градиент и проецирует различия, создавая компонент, чувствительный к кривизне, который направляет оптимизатор, избегая препятствий и следуя оптимальному пути. Это улучшает стабильность и скорость сходимости.

Как это работает:

  • Средний градиент указывает направление.
  • Различие градиентов действует как датчик местности, показывая, плоский или крутой ландшафт.
  • FOP комбинирует оба сигнала, добавляя шаг, учитывающий кривизну, перпендикулярный основному направлению.

Это приводит к более быстрой и стабильной сходимости, даже при экстремальных размерах пакетов, где традиционные методы сталкиваются с трудностями.

FOP на практике: в 7.5 раз быстрее на ImageNet-1K

Результаты впечатляют:

  • ImageNet-1K (ResNet-50): Для достижения стандартной валидационной точности (75.9%) SGD требует 71 эпоху и 2,511 минут, в то время как FOP достигает той же точности всего за 40 эпох и 335 минут — что приводит к ускорению в 7.5 раз.
  • CIFAR-10: FOP в 1.7 раз быстрее, чем AdamW, и в 1.3 раза быстрее, чем KFAC. При максимальном размере пакета (50,000) только FOP достигает 91% точности, другие методы терпят неудачу.
  • ImageNet-100 (Vision Transformer): FOP в 10 раз быстрее, чем AdamW, и в 2 раза быстрее, чем KFAC при больших размерах пакетов.
  • Долгие наборы данных: FOP снижает ошибку Top-1 на 2.3–3.3% по сравнению с сильными базовыми линиями.
  • Масштабируемость: FOP сохраняет сходимость даже при размерах пакетов в десятки тысяч, в отличие от существующих методов, которые теряют эффективность.

Почему это важно для бизнеса, практики и исследований

Для бизнеса сокращение расходов на обучение на 87% меняет экономику разработки ИИ. Команды могут реинвестировать сэкономленные средства в более крупные модели или более быстрые эксперименты.

Для практиков FOP легко реализовать с помощью открытого кода, который можно интегрировать в существующие рабочие процессы PyTorch с минимальными изменениями.

Для исследователей FOP переопределяет понятие «шума» в градиентном спуске, подчеркивая важность внутрипакетной вариации для реальных приложений.

Как FOP меняет ландшафт

Традиционно большие пакеты вызывали проблемы, приводя к нестабильности оптимизаторов. FOP использует вариации градиентов внутри пакета, что позволяет обеспечить стабильное и эффективное обучение на беспрецедентных масштабах, что является значительным сдвигом в стратегиях оптимизации.

Итог

Fisher-Orthogonal Projection (FOP) представляет собой значительное достижение в области обучения ИИ на большом масштабе, обеспечивая до 7.5× более быструю сходимость на наборах данных, таких как ImageNet-1K, при этом улучшая обобщение и снижая уровни ошибок на сложных данных. Используя и сохраняя вариацию градиентов, FOP оптимизирует процесс обучения, что приводит к значительным сокращениям затрат и позволяет исследователям и компаниям быстрее внедрять инновации. Его простая реализация в PyTorch делает его практическим решением для будущего машинного обучения.

Новости в сфере искусственного интеллекта