Сравнение устойчивости алгоритмов CISPO и DAPO при обучении моделей
A@AIexTimeAI-инженер
1 месСравнение алгоритмов CISPO и DAPO в асинхронном режиме обучения, включая поведение на модели Qwen3 30B MoE.
Выбор алгоритма оптимизации критически влияет на стабильность обучения больших моделей в асинхронном режиме.
- CISPO показывает большую устойчивость к выбору гиперпараметров по сравнению с DAPO.
- DAPO подвержен деградации при увеличении асинхронности (количества шагов).
- Модели архитектуры MoE, такие как Qwen3 30B, особенно чувствительны к ошибкам роутинга при асинхронном обучении.
Какое-то время назад открыл для себя, насколько CISPO робастнее к выбору гиперпараметров по сравнению с DAPO и насколько он по дефолту работает лучше в async режиме. На async в 64 шага дефолтный DAPO деградирует безумно сильно, да и на 16 уже заметно
Для Qwen3 30B MoE картина та же, только коллапс в async происходит еще раньше из-за проблем с разным роутингом экспертов

КонтекстAI
CISPO и DAPO — это методы оптимизации, используемые при обучении больших языковых моделей, особенно в распределенных или асинхронных средах. Проблема асинхронности часто приводит к нестабильности градиентов, что критично для MoE (Mixture of Experts) моделей, где роутинг экспертов требует высокой точности.
Кратко (AI)
Автор делится наблюдениями о превосходстве алгоритма CISPO над DAPO в условиях асинхронного обучения. Отмечается, что DAPO демонстрирует значительную деградацию при увеличении количества шагов, особенно на архитектурах типа MoE, таких как Qwen3 30B.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖