← к ленте

Дайджест AI/ML: Seedance 2.5, H3, Gemini Robotics ER 2 и другие релизы

Б@boris_againAI-инженер
3 нед

Обзор ключевых событий в мире AI за неделю: новые модели от ByteDance, MiniMax, Google, DeepSeek, Moonshot AI и OpenAI.

Индустрия AI ускоряет развитие мультимодальных моделей и инструментов для работы с видео.

  • Появление новых моделей для генерации видео высокого качества упрощает создание контента.
  • Снижение стоимости инференса и новые инструменты транскрипции делают AI-решения доступнее для бизнеса.
  • Ведущие специалисты отрасли призывают к государственному регулированию разработки мощных моделей.
#дайджест Дайджест AI/ML за неделю 27 июля - 2 августа 2026 ByteDance: Seedance 2.5 Теперь генерирует 4K-видео до 30 секунд за один проход. Можно принести до 50 референсов: 30 изображений, 10 видео, 10 аудио, сценарии, раскадровки и описания персонажей. Для точного переноса движения принимает видео на хромакее или анимацию белой 3D-болванки, а отдельные области результата можно переделывать без перегенерации всего ролика. В Dreamina также тестируют extended mode на 5–180 секунд, но это уже надстройка для длинных видео с несколькими сценами. Модель доступна в Dreamina, дают бесплатные ежедневные кредиты. Страница модели MiniMax: H3 Новая мультимодальная генеративная модель принимает текст, изображения, видео и аудио, а выдает видео до 15 секунд в 2K с нативным стереозвуком.  Модель генерирует и редактирует картинки, видео и аудио, делает перенос движения, работу с референсами и multi-shot. В общем, все ещё пытаются в кнопку "сделать красиво". Полные веса собираются открыть скоро, техрепорт тоже обещают потом. Блогпост Google DeepMind: Gemini Robotics ER 2 Модель смотрит непрерывный видеопоток, разбивает задачу на шаги, передает команды VLA-моделям и другим контроллерам, а затем проверяет, действительно ли робот все сделал. Может параллельно думать и действовать, вызывать Google Search и пользовательские функции, замечать ошибки и повторять неудачные шаги, также есть возможность работы нескольких роботов над одной задачей. Модель доступна через Gemini API и AI Studio. Блогпост DeepSeek: V4 Flash 0731 DeepSeek сделали посттренинг V4 Flash, не меняя архитектуру и размер модели. На собственных прогонах получили 82.7% на Terminal-Bench 2.1, 54.4% на DeepSWE и 70.3% на Toolathlon Verified. Цена - $0.14/$0.28 за миллион токенов и $0.0028 за закэшированный ввод. Список изменений Moonshot AI: Kimi K3 Moonshot сдержали обещание и выложили полные веса 2.8T-модели: 104B активных параметров, 896 экспертов, 16 активных и контекст 1М. Веса сразу квантованы в MXFP4, потому что даже так запускать трехтриллионную модель дома придется вместе с соседями. Также вышел техрепорт с разбором Kimi Delta Attention, Attention Residuals и Stable LatentMoE. Техрепорт, веса Pacing the Frontier: открытое письмо от сотрудников фронтир лаб 1324 сотрудника OpenAI, Anthropic, Google, Meta и других лабораторий подписали обращение к правительству США. Они просят создать механизм замедления разработки фронтир моделей, если экспонента попрет в сингулярность. Компании находятся внутри трагедии общин, поэтому нужна внешняя регуляция. Подписали Илья Суцкевер, Дарио Амодеи, Джон Шульман и др. Обращение OpenAI: GPT Transcribe и GPT Live Transcribe Две новые speech-to-text модели: GPT Transcribe расшифровывает файлы и завершенные реплики за $0.0045 в минуту, GPT Live Transcribe отдает текст кусками прямо во время разговора за $0.017 в минуту. Обеим можно передать контекст, нужные термины и список языков, а у Live настраивается компромисс между задержкой и точностью. GPT Transcribe, GPT Live Transcribe Google: Lyria 3.5 Апдейт музыкальной модели Google. По отзывам стало лучше, но все еще не Suno. Хотя из явных плюсов, если вас уже воротит от типичного звучания Suno, у этой модели оно немного другое. Пока доступна только в Google Flow Music, про API не рассказали. Блогпост Менее значительные релизы: OpenAI: открытия в математике Astra (следующая модель OpenAI размера Mythos) за $2к нашла решения и улучшения для десяти задач в разных сферах математики Публикация OpenAI: GPT-5.6 подешевели - Terra теперь стоит $2/$12, а Luna $0.20/$1.20 за миллион токенов. Sol осталась на $5/$30. Внутри компании Sol помогла переписать GPU-ядра и снизить стоимость инференса на 20%. Блогпост Thinking Machines Lab: Inkling-Small - компания Миры Мурати выпустила маленькую версию своей модели. Опенсорс, 276B параметров и 12B активных, с контекстом 1М, нативные изображение и аудио. Блогпост, веса

Кратко (AI)

Еженедельный обзор обновлений в сфере искусственного интеллекта, включающий новые видеогенеративные модели от ByteDance и MiniMax, развитие робототехники от Google DeepMind и релизы новых языковых моделей. Также освещаются вопросы регулирования индустрии и обновления в сервисах OpenAI.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖