ИИ

MiniMax H3: команда провела AMA на Reddit и рассказала о планах развития модели

Команда разработчиков MiniMax H3 провела большую AMA-сессию на Reddit (r/StableDiffusion), ответив на множество вопросов сообщества о будущем модели генерации видео/изображений H3. Главные анонсы: открытие модуля H3-Regenerate-2Ki для генерации в повышенном разрешении и первая версия sparse attentioni для ускорения инференса — оба «относительно скоро», но без точных дат.

Для пользователей это важно тем, что MiniMax впервые раскрыла техническую архитектуру своих ключевых наработок и подтвердила курс на open-source — то есть локальные пользователи H3 в обозримом будущем получат доступ к инструментам, которые раньше были закрытыми.

2Kразрешение модуля Regenerate
4/8-stepрассматриваемый быстрый режим инференса

Полный разбор →

Коллекция из 81 LoRA персонажей для Krea 2 и Pony

Н@neuroskladAI-инженер
2 нед
Коллекция из 81 LoRA персонажей для Krea 2 и Pony

Firecrawl представил инструмент Anydoc для конвертации документов в Markdown

Н@GreenNeuralRobotsAI-инженер
2 нед
Anydoc Еще один парсер документов от Firecrawl для быстрой конвертации в Markdown без потери структуры и качества • конвертация PDF, Word, презентаций и 10+ форматов • сохранение качества обработки во всех типах файлов • скорость 500 docx за 1,7 секунды • поддержка широкого спектра форматов #any2markdown #ocr

Нейропрожарка: короткометражка Black Fryday сделана на Nano Banana, Kling и Seedance

М@cgeventAI-инженер
2 нед

Alibaba открыла публичную бету видеомодели Wan 3.0 с генерацией роликов до 30 секунд со звуком

Alibaba запустила публичную бету новой модели генерации видео Wan 3.0. Модель умеет создавать ролики со звуком длительностью до 30 секунд в разрешениях 480p, 720p и 1080p, лучше сохраняет персонажей и сцену на длинной дистанции и поддерживает «омни-референсi» — на вход можно подавать не только текст и изображения, но и аудио, видео, документы и веб-страницы.

Это важно, потому что Wan 3.0 заметно расширяет возможности AI-видео: помимо обычного text-to-video и image-to-video, модель может продолжать уже готовый ролик, автоматически подбирать длительность и переносить в результат конкретные атрибуты — лицо, голос, одежду, логотипы, стиль — из референсных материалов, включая офисные файлы и презентации.

30 секундмаксимальная длительность генерируемого видео
$0.04–$0.20цена за секунду видео по API (разные источники)
100 МБ / 50 страницлимит загружаемого документа-референса

Полный разбор →

Анализ использования LLM для генерации кода без библиотек

з@ctodailyмедиа / агрегатор
2 нед
А вот это красивая атака. С этим хорошо сочетается то, что теперь можно писать всё вообще без библиотек, LLM вытащит только те кусочки кода, которые нужны именно твоему проекту. Конечно, всё сломается на интеграциях, но это уже следующая серия балета.
Анализ использования LLM для генерации кода без библиотек

xAI выпустила Grok Imagine Image 2.0 с упором на точечное редактирование изображений

xAI открыла всем пользователям Imagine Image 2.0 — обновлённую версию генератора картинок Grok Imagine, доступную на сайте grok.com/imagine и в приложениях Grok для iOS и Android. Главное отличие от предыдущей версии — акцент не на генерации с нуля, а на точечной правке: можно менять только нужный участок изображения без перегенерации всей картинки. Image 2.0 заменяет прежний Quality Modei в Grok Imagine.

По данным Метаверсище и ИИще, на бенчмарке Arenai модель занимает 2-е место одновременно в категориях Text-to-Image и Image Editing, уступая только GPT-Image-2.

2-е месторейтинг Arena в Text-to-Image и Image Editing
до 5 изображенийреференсов в мультиредактировании
2Kзаявленное максимальное разрешение вывода

Полный разбор →

Проблема ложных обвинений в использовании ИИ в образовании

D@droidergramавтор про «tech»
2 нед
Проблема ложных обвинений в использовании ИИ в образовании

Управление iPhone через ИИ-агентов с помощью phone-harness

T@tips_aiAI-инженер
2 нед

Google тихо отменила Gemini 3.5 Pro

AI-редакция
2 источника · показать все· свернуть
собирается · 2обновлено 2 нед назад

По данным SemiAnalysisi, Google отменила релиз модели Gemini 3.5 Proi — новая версия оказалась примерно на уровне устаревшего Opus 4.5i, тогда как конкуренты (GPT-5.6, Fable 5 и китайские модели) успели уйти вперёд.

Вместо релиза Gemini 3.5 Pro компания переключила внимание на раскрутку хайпа вокруг будущей Gemini 4. Таким образом, Gemini 3 Pro остаётся последним релизом линейки и, по мнению источников, символом момента, когда Google была близка к лидерству на рынке ИИ-моделей.

Полный разбор →

Google перестраивает руководство ИИ: Хассабис уходит с поста CEO DeepMind, Джефф Дин покидает компанию после 27 лет

AI-редакция
15 источников · показать все· свернуть
техноданяДемис Хассабис покидает пост главы Google DeepMindPRO Hi-TechДжефф Дин и Демис Хассабис покидают свои посты в Google и DeepMindFuturisКадровые перестановки в Google: Демис Хассабис и Джефф Дин меняют ролиTechSparksДемис Хассабис покидает пост CEO Google DeepMindvc.ruДжефф Дин покидает Google для запуска ИИ-стартапа Discovery LoopБлоGнотКадровые перестановки в Google DeepMind и уход Джеффа ДинаGPT/ChatGPT/AI Central Александра ГорногоКадровые перестановки в руководстве Google DeepMind3DNewsКадровые перестановки и уходы ключевых исследователей в Google DeepMindData SecretsКрупные кадровые перестановки в Google DeepMind и уход Джеффа ДинаKantor.AIДжефф Дин покидает Google для создания стартапа Discovery LoopХайтек+Google теряет ключевых ИИ-исследователей: основан стартап Discovery LoopСиолошнаяКадровые перестановки в Google и задержки релизов AI-моделейЭтихлидДжефф Дин покидает Google для запуска стартапа Discovery LoopData SecretsСлухи об уходе Демиса Хассабиса из Googlevc.ruGoogle реорганизует DeepMind на фоне проблем с разработкой ИИ
хайп · 15обновлено 2 нед назад

Google объявила о крупной кадровой перестройке в сфере ИИ. Демис Хассабис оставляет пост CEO Google DeepMind и переходит на новые для компании должности — председатель совета директоров DeepMind и главный научный сотрудник (Chief Scientist) Alphabet. Оперативное управление лабораторией, включая релизы Gemini и фронтир-исследования, переходит к Кораю Кавукчуоглу (Koray Kavukcuoglu), ранее CTO DeepMind, с прямым подчинением Сундару Пичаи.

Одновременно из Google после 27 лет работы уходит легендарный инженер Джефф Дин (Jeff Dean) — вместе с исследователями Санджаем Гемаватом (Sanjay Ghemawat), Ориолом Виньялсом (Oriol Vinyals) и Куоком Ле (Quoc Le) он запускает независимый стартап Discovery Loopi, ориентированный на автоматизацию научных исследований с помощью ИИ; Google при этом выступает инвестором и облачным партнёром проекта. Новости совпали с падением акций Alphabet и слухами о задержке модели Gemini 3.5 Pro, что усилило разговоры об отставании Google в гонке фронтир-ИИ.

27 летстаж Джеффа Дина в Google
4-5%падение акций Alphabet после новостей (данные источников разнятся)
2024год Нобелевской премии Хассабиса по химии за AlphaFold 2

Полный разбор →

Meta выпустила ИИ-агента для программирования Muse Code

Meta (организация признана экстремистской, деятельность в РФ запрещена) представила публичную бета-версию Muse Code — ИИ-агента для сложных задач разработки ПО на macOS и Linux. Проект выпустило подразделение Superintelligence Labsi под руководством Александра Ванга. Агент запускается одной командой в терминале и умеет автономно планировать изменения, писать код в крупных репозиториях и самостоятельно проверять результат.

Особый интерес вызвала ценовая политика: пользователям, согласным передавать Meta обезличенные данные для обучения будущих моделей, доступ обходится в 10 раз дешевле обычного тарифа — фактически это делает Muse Code дешевле конкурента DeepSeek V4 Flash.

59%результат на бенчмарке DeepSWE 1.1
$1,25/$4,25цена за млн токенов, обычный тариф
$0,10/$0,20цена за млн токенов, Contributor Tier

Полный разбор →

Ещё ↓