← к ленте

Сравнение устойчивости алгоритмов CISPO и DAPO при обучении моделей

A@AIexTimeAI-инженер
1 мес

Сравнение алгоритмов CISPO и DAPO в асинхронном режиме обучения, включая поведение на модели Qwen3 30B MoE.

Выбор алгоритма оптимизации критически влияет на стабильность обучения больших моделей в асинхронном режиме.

  • CISPO показывает большую устойчивость к выбору гиперпараметров по сравнению с DAPO.
  • DAPO подвержен деградации при увеличении асинхронности (количества шагов).
  • Модели архитектуры MoE, такие как Qwen3 30B, особенно чувствительны к ошибкам роутинга при асинхронном обучении.
Какое-то время назад открыл для себя, насколько CISPO робастнее к выбору гиперпараметров по сравнению с DAPO и насколько он по дефолту работает лучше в async режиме. На async в 64 шага дефолтный DAPO деградирует безумно сильно, да и на 16 уже заметно Для Qwen3 30B MoE картина та же, только коллапс в async происходит еще раньше из-за проблем с разным роутингом экспертов
Сравнение устойчивости алгоритмов CISPO и DAPO при обучении моделей
КонтекстAI
CISPO и DAPO — это методы оптимизации, используемые при обучении больших языковых моделей, особенно в распределенных или асинхронных средах. Проблема асинхронности часто приводит к нестабильности градиентов, что критично для MoE (Mixture of Experts) моделей, где роутинг экспертов требует высокой точности.

Кратко (AI)

Автор делится наблюдениями о превосходстве алгоритма CISPO над DAPO в условиях асинхронного обучения. Отмечается, что DAPO демонстрирует значительную деградацию при увеличении количества шагов, особенно на архитектурах типа MoE, таких как Qwen3 30B.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖