← к ленте

Дайджест AI/ML: Wan 3.0, Grok Imagine 2.0, MiniMax H3 и другие релизы

Б@boris_againAI-инженер
2 нед

Обзор ключевых AI-релизов за неделю: Wan 3.0 от Alibaba, Grok Imagine 2.0, открытые веса MiniMax H3, Muse Code от Meta и другие новинки.

Индустрия генеративного ИИ стремительно развивается, предлагая новые инструменты для работы с видео, кодом и 3D-графикой.

  • Alibaba и MiniMax представили мощные модели для генерации видео, расширяя возможности создания контента.
  • Meta и Liquid AI выпускают специализированные модели для агентного кодинга и локальных вычислений.
  • Появление новых версий популярных моделей (Grok, GPT) повышает качество генерации изображений и текста для конечных пользователей.
#дайджест Дайджест AI/ML за неделю 3–9 августа 2026 Alibaba: Wan 3.0 Омнимодальная видеомодель: на вход можно подавать текст, изображения, аудио и видео. Интерфейс также умеет извлекать контекст из файлов, веб-страниц и сложных изображений, чтобы использовать их как референсы. Максимальная длительность — до 30 (!) секунд за одну генерацию. Публичная бета доступна в Alibaba Cloud Model Studio и Qwen Cloud. Пост, Попробовать xAI: Grok Imagine Image 2.0 Новая версия с хорошим рывком по качеству, проигрывает только GPT-Image 2 1320 vs 1380 Elo в генерации и 1439 vs 1463 в редактировании. Есть все современные инструменты редактирования, ресайз, работа с референсными изображениями, масками и сегментацией API пока нет, только на сайте. Grok Imagine MiniMax: открытые веса H3 Два чекпойнта видеомодели: FL2VA для генерации по тексту и первому/последнему кадру и Ref2VA для работы с наборами изображений, видео и аудио. На выходе H3 делает ролики 15 секунд, 24 fps с нативным звуком. Внутри трансформер на 33B параметров. Локально открытый H3-Base генерирует видео в 768. H3-Context-IR, который разбирает сложный мультимодальный контекст, в релиз не вошёл. Как и Апскейлер до 2к H3-Regenerate-2K. Реализация sparse attention тоже будет когда-нибудь потом. В общем веса открыли, но полный продакшен-пайплайн все еще требует API MiniMax. GitHub, веса Meta: Muse Code и Muse Spark 1.2 Meta тоже сделала себе суверенный Claude Code - Muse Code. Работает все это на Muse Spark 1.2 новой версии модели Meta, акцент на агентном кодинге с долгим горизонтом планирования. В экспериментах агенты до суток оптимизировали GPU-ядра и делали больше тысячи вызовов инструментов. Muse Code пока в бете, Spark 1.2 доступна в нем и через Meta Model API. Блогпост CMU: Lift4D Система превращает одно обычное видео движущегося объекта в 4D объект из Gaussian Splatting. Восстанавливает геометрию, внешний вид и движение, включая стороны, которые камера не видела. Результат можно крутить вертеть по всем осям, включая время. Проект, GitHub Alibaba: Wan-Animate-2 Открытая 14B-модель которая анимирует персонажей с изображения движениями из референсного видео. В отличие от первого Animate, модель принимает исходное видео прямо внутри DiT, раньше отдельно извлекалась поза и по ней уже происходила генерация, также можно менять ракурс итогового видео через промпт. Выложили базовые и дистиллированные веса: вторая версия работает за 10 шагов вместо 40. 720p рассчитан на 8×A800, а 480p проверяли на 2×A800. Отличный локальный генератор для всех, у кого локально стоит небольшой дата-центр. GitHub, веса Tencent: Hunyuan3D-Buffalo 1.0 К генератору 3D моделей Hunyuan3D-2.1 пришили 3D-VLM, которая может делать VLM штуки, вроде понимать что такое крылья и где у машины перед. В итоге хотят добиться более точного редактирования 3D моделей. Но пока это исследовательская работа и красивая страница с примерами. Ссылка на код подписана Stay Tuned, весов тоже нет. Проект, статья Liquid AI: LFM2.5-2.6B Маленькая текстовая модель для локальных агентов: 2.69B параметров, 128К контекста, function calling и обязательный ризонинг. Модель натренировали примерно на 34T токенов и отдельно доучили работать с инструментами внутри агентных окружений. Liquid заявляет до 220 токенов/с при потреблении меньше 2.5 ГБ памяти. По сравнению с 4B моделями Qwen и Gemma немного выигрывает по агентным бенчам и проигрывает по всему остальному. Блогпост, веса Менее значительные релизы: Alibaba: Qwen3.8-Max Уже обозревали, но теперь из названия убрали Preview. Доступна через QwenCloud API и продукты Qwen. Веса пообещали на следующей неделе. Анонс, документация LightX2V: MiniMax-H3 Turbo 4-Step - LoRA, которая сокращает генерацию H3 с 50 до 4 шагов. GitHub, веса OpenAI: GPT-5.6 Luna теперь безлимитна для бесплатных пользователей через ChatGPT. Также минорно улучшили Sol. Блог FLUX 3 Video вышел в API

Кратко (AI)

Еженедельный обзор значимых обновлений в сфере искусственного интеллекта. Основные события включают запуск мультимодальной модели Wan 3.0 от Alibaba, обновление генератора изображений Grok Imagine 2.0, открытие весов видеомодели H3 от MiniMax и релиз агентной модели Muse Code от Meta.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖