Alibaba представила флагманскую модель Qwen3.8-Max — MoEi-модель на 2,4 трлн параметров (активируется около 95 млрд при каждом запросе), контекст — 1 млн токенов. Модель уже доступна в Qwen Chat и по API, а через неделю компания впервые откроет веса модели класса Max — вместе с более компактной Qwen3.8-27B. Это первый случай, когда Alibaba открывает веса модели уровня Max (по данным vc.ru).
Главный акцент — автономная агентная работа и мультимодальность: модель по заявлению компании способна вести длинные проекты почти без вмешательства человека (планирование, код, запуск инструментов, анализ обратной связи), а также нативно работать с изображениями внутри цикла «планирование — выполнение — проверка». По ряду бенчмарков она обгоняет GPT-5.6 Sol и Claude Fable 5, но в чистом программировании (DeepSWE, FrontierSWE) уступает Kimi K3, Fable 5 и GPT-5.6 Sol.
- Цена API: $2 за 1 млн входных токенов, $6 за выходные, $0,25 за кэшированные входные — примерно втрое дешевле Kimi K3 ($3/$15) и в разы дешевле Claude Fable 5 ($10/$50); для сравнения GLM-5.2 стоит $1,4/$4,4, а DeepSeek V4-Flash — $0,14/$0,28
- Данные об автономной работе разнятся по источникам: 16 дней (CodeCamp, Data Secrets, Igor Akimov/Neural Shit/Метаверсище, Хайтек+, NEURO-AI), «более 2 недель» (Futuris), «более 10 дней» (ITc, Хайтек+ 3.08), «больше десяти дней» на проекте oh-my-clii (Machinelearning)
- Пример автономной разработки — проект oh-my-cli с саморазвивающимся кодинговым харнесом, полный журнал изменений опубликован в открытом GitHub-репозитории qwen-code-dev-bot/oh-my-cli
- Модель за ~125 часов написала 7 600 строк кода для проверки научной статьи, провела 33 раунда GPU-обучения, воспроизвела все 6 выводов статьи, проверила 18 своих гипотез и превзошла метод авторов на +2,7 пункта
- В задаче оптимизации чипа модель за 500 ходов уменьшила площадь кристалла (по данным Igor Akimov/Neural Shit/Метаверсище — в 5 раз, по данным NEURO-AI — в 12 раз) — лучший результат среди проверенных моделей
- По NEURO-AI, модель также год торговала в симуляторе и учетверила деньги, а на конкурсе обошла 458 команд из 526
- Бенчмарки: PaperBench 93,0 (у GPT5.6 Sol — 90,5), MathVision 95,2, CharXiv 88,4, OmniDocBench 92,1; при этом DeepSWE 56,6 (ниже Kimi K3 — 67,5, Fable 5 — 70,0, GPT5.6 — 73,0), FrontierSWE 73,5 против 81,2 у Kimi K3
- Рейтинги Arenai расходятся: по данным Нейронавт — 2-е место по изображениям, 4-е во фронтенде; по Хайтек+ — лучшая китайская модель по тексту и 2-е место в мире по изображениям (после Fable 5); по vc.ru — 4-е место в AI Arena по веб-разработке после Claude Opus 5 и Kimi K3
- В промо-видео Alibaba модель показана проектирующей чипы и работающей с биологическими данными — источники (Machinelearning, Миша Ларченко) трактуют это как намёк на конкуренцию с США в полупроводниках и науке (аналог AlphaFold) на фоне ограничений США на поставки ускорителей Китаю
На следующей неделе Alibaba планирует открыть веса Qwen3.8-Max и компактной Qwen3.8-27B — впервые для модели класса Max. Опубликованные бенчмарки пока не проверены независимо (отмечает Хайтек+), поэтому реальное сравнение с GPT-5.6 Sol, Fable 5 и Gemini 3.1 Pro станет ясно после открытого доступа к весам.
Это произошло: Обзор новых ИИ-инструментов и моделей: DeepSeek, Google, OpenAI и другие →
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖