генерация изображенийСбросить фильтр ×

Microsoft Paint и Photos добавляют скрытые водяные знаки при генерации

Х@habr_comмедиа / агрегатор
6 ч
Microsoft Paint и Photos добавляют скрытые водяные знаки при генерации

Релиз модели SenseNova U1.5 Lite

Н@GreenNeuralRobotsAI-инженер
10 ч
SenseNova U1.5 Lite Полноценный релиз U1.5 Lite - Шесть улучшений: качество картинки, сложные инструкции, текст (англ и кит) без иероглифической каши, нативный 4K, редактирование с сохранением оригинала, точный контроль через bbox + мульти-референс Гитхаб HF Попробовать ——— Кванты SenseNova-U1.5-8B-MoT-T8-convrot для 12GB+ VRAM INT8 ConvRot 17.6 GB и гибрид W4A8 13.8 GB - работает на RTX 4070 12GB при 2048x2048 8-шаговая LoRA скорости в комплекте ComfyUI #t2i #int8 #convrot #4k #imageediting VK | MAX
Релиз модели SenseNova U1.5 Lite

Релиз модели генерации изображений Fibo 1.5 от Bria AI

Н@GreenNeuralRobotsAI-инженер
19 ч
Fibo 1.5 (Bria AI) Дистиллированная версия картинкогенератора FIBO 4-6 шагов вместо 50, без CFG, с улучшенным реализмом и текстурами. Дистилляция DMD + DMD-R поверх оригинального FIBO. При этом сохраняет JSON-native структурированный промптинг Fibo-Edit-1.5-base - редактирующая с мультиреференсом Есть турбоверсия HF - полный зоопарк ИИ-скилл #imageediting #json2image #skill VK | MAX
Релиз модели генерации изображений Fibo 1.5 от Bria AI

OpenAI добавила в ChatGPT генератор стикерпаков

AI-редакция
2 источника · показать все· свернуть
собирается · 2обновлено 3 дн назад

OpenAI обновила мобильное приложение ChatGPT, добавив отдельный инструмент для создания стикеров для мессенджеров. Функция доступна через боковое меню: раздел «Images», далее — «Stickers».

Сервис может как рисовать стикеры по текстовому описанию, так и вырезать объекты с загруженных фотографий с автоматическим удалением фона. Готовые стикеры можно отправить в iMessage или WhatsAppi.

9максимум стикеров в паке за запрос
18доступных визуальных стилей

Полный разбор →

Выход MiniMax-H3-Fun-Controlnet-Union от Alibaba PAI

Н@GreenNeuralRobotsAI-инженер
4 дн
MiniMax-H3-Fun-Controlnet-Union Единый контролнет для MiniMax-H3 от Alibaba PAI Canny, Depth, HED, MLSD, Pose Работает только с точной конфигурацией веток из трейна, иначе чекпоинт не загрузится Гитхаб HF Спасибо @StanShumsky #minimaxH3 #controlnet VK | MAX

Новый подход к генерации изображений от Alibaba

Н@GreenNeuralRobotsAI-инженер
5 дн

WithEveryone: фреймворк для генерации групповых портретов

Н@GreenNeuralRobotsAI-инженер
6 дн
WithEveryone Фреймворк от Tencent Hunyuan и Fudan для генерации групповых портретов До 10 человек в одном кадре, каждый со своим референсом лица - Планирование до синтеза: модель решает, кто участвует, где стоит каждый и как построена группа, потом рендерит layout как условие - Layout CoT привязывает личности к лицам, телам и ключевым точкам позы Модель в процессе обучения, может потом поделятся, а может и нет #referencing #research VK | MAX
WithEveryone: фреймворк для генерации групповых портретов

Анонс мультимодальной модели SenseNova-U1.5-8B-MoT

Н@GreenNeuralRobotsAI-инженер
1 нед
SenseNova-U1.5-8B-MoT Превью мультимодалки от SenseNova. Полную ждем Понимание и генерация картинок в одном трансформере. Никакого VAE, текстового энкодера и DiT - Текст и картинка используют разные веса в смеси трансформеров, но аттендят друг на друга - Нативный 4K - Уверенный рендер текста на китайском и английском - Точное редактирование - Понимает структурированные длинные промпты без отдельного обучения - на Qwen-Image Bench - уровень Nano Banana 2 - на ImgEdit-Bench и GEdit-Bench обходит Nano-Banana и Qwen-Image-2 Гитхаб HF Есть 8-шаговая лора Попробовать Comfyui #4k #vlm #imageediting VK | MAX

ComfyUI-MiniMax-H3-Studio: интеграция MiniMax H3 в ComfyUI

Н@GreenNeuralRobotsAI-инженер
1 нед
ComfyUI-MiniMax-H3-Studio Надстройка над MiniMax H3 для ComfyUI Генерация изображений без ручной сборки графа. Один воркфлоу, три режима, все H3 внутри - Текстовое описание → изображение (FL2VA) - Редактирование по референсу: до 9 изображений, каждому назначается роль - Image-to-image с сохранением канвы, независимым разрешением - Face Refine: дорисовка мелких лиц через повторный H3-прогон - Сэмплинг Base 20 шагов, LightX 8/4 шага, PDD 4 шага - Qwen3-VL анализирует референсы и пишет компактную инструкцию #comfyui #munumaxH3 #t2i #imageediting #fl2va VK | MAX
ComfyUI-MiniMax-H3-Studio: интеграция MiniMax H3 в ComfyUI

Разбор версий и позиционирования моделей MAI-Image-2.5-Pro и MAI-Image-2.6

М@cgeventAI-инженер
1 нед

Microsoft выпустила модель MAI-Image-2.5-Pro

э@ai_newzAI-инженер
1 нед
Microsoft выпустила модель MAI-Image-2.5-Pro

Анонс новой модели OpenAI luna-lisa-alpha

М@cgeventAI-инженер
1 нед
GPT image 2.5 На арене новый чекройнт от openAI под названием luna-lisa-alpha Обновили knowledge coutoff Приподубрали зерно Вроде не желтит Ждём официального анонса. @cgevent
Анонс новой модели OpenAI luna-lisa-alpha

Alibaba представила фреймворк для рекомендаций правок в генерации изображений

Н@GreenNeuralRobotsAI-инженер
1 нед
What to Edit Next Фреймворк от Alibaba для рекомендаций следующих правок в чате по генерации картинок. После каждой итерации подсказывает, что отредактировать дальше - чтобы совет был уместным, разнообразным и выполнимым на текущем изображении. На базе Qwen3-VL-8B кода-весов нет #research #vlm
Alibaba представила фреймворк для рекомендаций правок в генерации изображений

Метод создания консистентных персонажей в FLUX.2 без обучения LoRA

Н@GreenNeuralRobotsAI-инженер
1 нед
Метод создания консистентных персонажей в FLUX.2 без обучения LoRA

Seedream 5.0 Pro получил функцию Layer Separation

М@cgeventAI-инженер
2 нед

Предостережение об использовании Heretic-моделей в генерации изображений

Н@GreenNeuralRobotsAI-инженер
2 нед
На реддите появился пост от создателя децензора Heretic Автор предостерегает от использования heretic-моделей в качестве текстовых энкодеров для H3 и прочих подобных генераторов По его словам, модификации Heretic, позволяющие обходить цензуру в LLM, не дают эффекта в генерации изображений и видео: LLM и без того корректно распознают "вредный" контент, а передача слегка изменённых представлений в модель диффузии не усиливает детализацию, но может ухудшить соответствие запросу и привести к артефактам. Юзеры подтверждают снижение качества генерации при таком подходе #news #uncensored

На Arena замечена анонимная модель Mona-lisa-1 — вероятный преемник GPT Image 2 от OpenAI

На платформе Arenai появился неанонсированный генератор изображений под названием mona-lisa-1, и сообщество подозревает, что это следующая модель генерации изображений от OpenAI — преемник GPT Image 2. Официальный сервис верификации OpenAI обнаружил на сгенерированных картинках скрытую фирменную маркировку, что укрепило подозрения, поскольку ложноположительные срабатывания такой системы крайне редки.

По первым сравнениям главное улучшение — фотореализм: меньше характерной «пластиковой» AI-кожи, лучше текстуры, освещение и мелкие детали, точнее следование сложным промптам и качественнее отрисовка текста. При этом революции пока не видно — в части тестов разница с GPT Image 2 небольшая, а привычные шумовые артефакты (комки и сетки вокруг текста и мелких деталей) сохранились.

Полный разбор →

Выход модели MAI-Image-2.6 от Microsoft

Н@GreenNeuralRobotsAI-инженер
2 нед
MAI-Image-2.6 Новая версия генератора картинок от Microsoft Поднялась на #2 в Arena text-to-image leaderboard, обойдя Google, Meta и xAI. +79 Elo к MAI-Image-2.5, +91 Elo только по отрисовке текста. Что улучшили • Отрисовка текста - главный скачок, +91 Elo • Портреты и 3D-изображения • Коммерческие и фотореалистичные сцены - товарка, брендинг, синематик • Мультиреференсная генерация - работа с несколькими исходниками • Более богатый grounding и контроль над форматом/разрешением Доступна на Arena, на MAI Playground - позже на этой неделе, в Microsoft Foundry в ближайшее время. Спасибо @Goog1le #t2i
Выход модели MAI-Image-2.6 от Microsoft

xAI выпустила Grok Imagine Image 2.0 с упором на точечное редактирование изображений

xAI открыла всем пользователям Imagine Image 2.0 — обновлённую версию генератора картинок Grok Imagine, доступную на сайте grok.com/imagine и в приложениях Grok для iOS и Android. Главное отличие от предыдущей версии — акцент не на генерации с нуля, а на точечной правке: можно менять только нужный участок изображения без перегенерации всей картинки. Image 2.0 заменяет прежний Quality Modei в Grok Imagine.

По данным Метаверсище и ИИще, на бенчмарке Arenai модель занимает 2-е место одновременно в категориях Text-to-Image и Image Editing, уступая только GPT-Image-2.

2-е месторейтинг Arena в Text-to-Image и Image Editing
до 5 изображенийреференсов в мультиредактировании
2Kзаявленное максимальное разрешение вывода

Полный разбор →

UniVR: агентная модель для генерации изображений

Н@GreenNeuralRobotsAI-инженер
2 нед
Модель для генерации изображений на базе UniVR. Сама решает когда рассуждать, когда обращаться к внешним инструментам, а когда рисовать. Делает это одной политикой, а не по жёсткому сценарию. Полностью агентное управление процессом генерации стабильно обгоняет варианты с фиксированным пайплайном или частичным контролем агента Гитхаб HF ждем #agent #t2i
UniVR: агентная модель для генерации изображений

Эволюция генерации изображений с 2019 года

D@datastorieslanguagesAI-инженер
2 нед
​​Генерация картинок в 2019 Я сейчас что-то вспомнил соревнование 2019 года на Kaggle по генерации изображений собак. Нашёл там тредик, где люди выкладывали, что у них получилось https://www.kaggle.com/competitions/generative-dog-images/discussion/97753 Выглядит жутковато. Прошло каких-то 7 лет, и теперь нередко сгенерированные изображения фиг отличишь от реальных. #ai

Релиз ComfyUI-Latent-Tiled-PiD для генерации изображений

Н@GreenNeuralRobotsAI-инженер
3 нед
ComfyUI-Latent-Tiled-PiD плаг энд плей декодер для диффузных картинкогенераторов прикрутили в комфи Воркфлоу на гитхабе Спасибо @m_franz #t2i #optimization #qwenimage #flux2 #flux #qi2512 #comfyui #4K
Релиз ComfyUI-Latent-Tiled-PiD для генерации изображений
Ещё ↓