← к ленте

Дайджест AI/ML: обновления моделей за 10–16 августа 2026

Б@boris_againAI-инженер
1 нед

Обзор обновлений LLM от xAI, Z.ai, Google, Meta, Alibaba и DeepSeek за неделю 10–16 августа 2026 года.

Рынок LLM стремительно развивается: новые модели показывают рекордные результаты в программировании и агентных задачах.

  • Разработчики получают более мощные инструменты для автоматизации написания кода.
  • Улучшение агентных способностей моделей позволяет эффективнее делегировать сложные задачи ИИ.
  • Конкуренция между вендорами ведет к снижению стоимости использования API и увеличению контекстного окна.
#дайджест Дайджест AI/ML за неделю 10–16 августа 2026 На этой неделе примерно все решили обновить свои модели, поэтому по разделам: LLM SpaceXAI: Grok 4.6 xAI обновила флагман для кода, агентов и визуальной работы. На Artificial Analysis Intelligence модель набрала 61 балл, как GPT-5.6 Sol Max, и на один балл меньше Fable 5 Max. На CursorBench получила 69.9% против 70.5% у Fable, а на DeepSWE - 65.9% против 70% у Fable и 73% у Sol. Контекст 500К, на входе текст и изображения. Цена осталась $2/$6 за миллион токенов, после 200К входного контекста тариф повышается. Fast-версия вдвое дороже. Уже доступна в API, Grok Build, Cursor, OpenRouter и других нормальных местах обитания агентов. Блогпост, Документация Z.ai: GLM-5.3 Архитектуру GLM-5.2 особо не трогали - основное улучшение получили за счет масштабирования посттрейна. В результате DeepSWE вырос с 46.2% до 66.9%, а CyberGym - до 84.5% (у Fable и Sol 83.8%). Последнее оказалось настолько хорошо, что открытие весов отложили примерно на две недели для дополнительной проверки кибербезопасности. Пока GLM-5.3 доступна через Z.ai и API. Потихоньку уходит от нас опенсорс. Блогпост, Документация Google: Gemini 3.7 Flash Модель с перформансом между Terra и Sonnet, но дешевле. На Terminal-Bench 2.1 модель выросла с 78% у 3.6 Flash до 85.8% (87.4% у Terra, 80.4% у Sonnet), на DeepSWE — с 48.6% до 65.3% (70% Terra, 54% Sonnet). Стала дефолтной моделью для управляемого агента в Antigravity. Принимает текст, изображения, видео, аудио и PDF. Контекст 1М, выход до 65К. До конца 2026 года действует стартовая цена $0.75/$3.75 за миллион токенов, после чего ее обещают удвоить, ведь через 5 месяцев модели августа 2026 будут актуальны с такой плотностью релизов Описание модели, Model Card Meta: Muse Glimmer 30B Glimmer дистилят на 30B из Muse Spark для локальных агентов: есть reasoning, tool use, код, изображения на входе и 131К контекста. По кодингу на уровне или чуть хуже Qwen3.6-27B, но выигрывает на агентных бенчах. Веса, GGUF Alibaba: Qwen3.8-2.4T-A95B и Qwen3.8-27B Alibaba как и обещала открыла веса двух Qwen3.8. Большая - MoE на 2.4T параметров и 95B активных, маленькая - 27B. У обеих 262К нативного контекста с возможностью растянуть до 1М. Веса 2.4T, Веса 27B DeepSeek: V4 Pro 0813 и свой Harness еще одно обновление V4 Pro. По официальной карточке это 1.6T параметров и 49B активных. Контекст 1М, максимальный выход 384К. На Terminal-Bench 2.1 модель набрала 87.9%, на DeepSWE 62.7%. Доступна в приложении, вебе и API, где для нее отдельно адаптировали Responses API под Codex. А еще у них теперь свой ClaudeCode, заявлено все по последней моде, пока в превью. Обновление, Модель, DeepSeek Harness

Кратко (AI)

Обзор ключевых релизов в сфере LLM за неделю: xAI представила Grok 4.6, Z.ai выпустила GLM-5.3, а Google обновила Gemini 3.7 Flash. Также вышли новые модели от Meta, Alibaba и DeepSeek, демонстрирующие значительный прогресс в кодинге и агентных задачах.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖