Релизы Qwen 3.8, DeepSeek V4 Pro и Grok 4.6
M@ai_machinelearning_big_dataAI-инженер
2 недОбзор новых моделей Qwen3.8-2.4T-A95B, DeepSeek V4 Pro 0813 и Grok 4.6 с их ключевыми характеристиками и бенчмарками.
Выход новых мощных нейросетей ускоряет развитие инструментов для автоматизации программирования и анализа данных.
- Появление моделей с огромным контекстным окном (1 млн токенов) позволяет обрабатывать целые кодовые базы.
- Агрессивное снижение цен на API от DeepSeek делает использование продвинутых моделей доступнее для бизнеса.
- Специализация Grok 4.6 на агентских задачах (coding, CAD) меняет подход к автоматизации сложных инженерных процессов.
🔥 Сразу три релиза за день: Qwen 3.8, DeepSeek V4 Pro и Grok 4.6
• Qwen3.8-2.4T-A95B - Qwen открыла веса своего самого большого монстра.
2,4 трлн параметров, 95B активных, 512 экспертов и контекст до 1 млн токенов. По eval команды, Qwen3.8-Max получает 86,6 на TerminalBench 2.1 и 93,0 на PaperBench, уже вплотную заходя на территорию закрытых frontier-моделей.
• DeepSeek V4 Pro 0813 - финальная Pro-версия появилась в официальном API.
Контекст 1 млн токенов, до 384K output, Responses API и tool calling. Цена особенно агрессивная: $0,435 за 1 млн входных токенов при cache miss и $0,87 за выход, а при cache hit вход падает до $0,003625. По опубликованным DeepSeek цифрам, Terminal-Bench 2.1 вырос с 72,1% до 87,9%, CyberGym с 52,7% до 83,3%, DeepSWE с 12,8% до 62,7%.
• Релиз Grok 4.6
Модель набрала 61 на Artificial Analysis Intelligence Index, столько же, сколько GPT-5.6 Sol, и обошла его на CursorBench, FrontierCode и AA-Briefcase. При этом GPT-5.6 Sol остаётся впереди на DeepSWE и Terminal-Bench. xAI отдельно прокачивала модель через agentic RL для coding, web development, CAD и kernel optimization, а на длинных задачах стала чаще появляться самостоятельная проверка результата.
@ai_machinelearning_big_data
#AI #Qwen #DeepSeek #Grok #LLM #Agents

Кратко (AI)
Состоялись релизы трех крупных языковых моделей: Qwen 3.8 с 2,4 трлн параметров, DeepSeek V4 Pro с обновленным API и Grok 4.6, оптимизированный для агентских задач. Новые модели демонстрируют значительный рост производительности в бенчмарках, приближаясь к показателям ведущих frontier-моделей.
Обсуждение
2512 экспертов и 1М контекст у Qwen — MoE наконец масштабируется без просадки по адекватности, это факт а не циферки для галочки. а вот цены DeepSeek на cache hit это вообще отдельная история, при таком раскладе держать кодового агента на постоянке будет стоить как подписка на музыку
MoE на 512 экспертов и миллион контекста уже давно не удивляют. Про «отсутствие просадки» — это всё красиво только на бенчах, в реальных агентских задачах всё равно сыпется. Цены у DeepSeek заманчивые, но это пока они не начали крутить настройки кэша или задержки.