generative-aiСбросить фильтр ×

Опубликованы веса и код редакторов RL3DEdit и HiFi-Inpaint

AI-редакция
2 источника · показать все· свернуть
собирается · 2обновлено 1 мес назад

Вышли в открытый доступ код и веса двух инструментов для редактирования изображений на базе нейросетей: RL3DEdit — редактор 3D-сцен, и HiFi-Inpaint — продуктовый редактор портретов.

RL3DEdit построен на основе VGGTi и FLUX-Kontext-devi и позволяет редактировать 3D-сцену через сетку изображений 3x3, представляющую собой вид сцены с разных ракурсов — то есть правки применяются согласованно ко всем ракурсам сразу.

3x3размер сетки ракурсов сцены в RL3DEdit

Полный разбор →

Claude Code для 3D-моделирования

S@SantryBlogAI-инженер
1 мес
Открытие этой недели: claude code умеет в трехмерное моделирование. Если установить пакет скиллов, то вполне можно создавать и редактировать трехмерные модели в текстовом чате. С Opus 4.8 это опыт близкий к ранним генераторам картинок. То есть, нужно четко формулировать ТЗ и постоянно направлять модель, но даже так она полезна. Я, например, редактировал stl. В Fusion 360 делать это жутко не удобно, а тут нужно было лишь немного поспорить с электронным болваном. Если верить твиттеру, Fable 5 моделит чуть ли не реактивные турбины целиком. Проверю, когда вернут доступ.

Pika представила функцию генерации видео через чат

N@v_neuroAI-инженер
1 мес
📱 Pika выкатила вещь, за которую раньше отвечал бы целый отдел моушн-дизайна. Кидаешь в чат своё селфи, пишешь /anime-soccer и через полминуты смотришь, как твоя аниме-версия с зелёными глазами и пирсингом лупит с разворота, вратарь в прыжке тащит мяч, вокруг молнии и рёв трибун. Всё внутри обычного чата, через #Pika MCP, без единого приложения. Двадцать шесть секунд эпика по одной команде. Забавно, как генераторы видео тихо переползают туда, где ты и так весь день сидишь - в переписку. А потестировать можно тут

Google представила модели Nano Banana 2 Lite и Gemini Omni Flash

Компания Google анонсировала две новые модели: Nano Banana 2 Lite для быстрой генерации изображений и Gemini Omni Flash для работы с видеоконтентом. Модель Nano Banana 2 Lite способна создавать изображения за четыре секунды, а Gemini Omni Flash позволяет редактировать и генерировать видеоролики длительностью до 10 секунд. Новые инструменты ориентированы на высокую скорость работы и бюджетную интеграцию в пайплайны генерации контента. Разработчикам предоставлен доступ к моделям через Google AI Studio и API, при этом отмечается, что качество видео пока остается нестабильным.

ComfyUI представила MCP-сервер для интеграции с ИИ-агентами

Команда ComfyUI анонсировала запуск публичной бета-версии MCP-сервера, который позволяет ИИ-агентам взаимодействовать с платформой через естественный язык. Новое решение дает возможность агентам автоматически находить ноды, создавать и редактировать графы генерации, что упрощает настройку сложных рабочих процессов. В дополнение к этому представлены Comfy CLI и репозиторий Comfy Skill для расширения возможностей автоматизации генеративных пайплайнов. Интеграция направлена на повышение воспроизводимости рабочих процессов и автоматизацию рутинных задач в командной разработке.

Сбер представил токенизатор KVAE-Audio для генеративных аудиомоделей

Сбер опубликовал в открытом доступе алгоритм KVAE-Audio, предназначенный для эффективного сжатия аудиоданных с коэффициентом 960x. Разработка оптимизирует процесс обучения диффузионных моделей и обеспечивает более высокое качество генерации звука по сравнению с аналогичными решениями от Sony, Meta и Stability AI. Новый токенизатор решает проблему компактности данных, что позволяет повысить эффективность работы генеративных нейросетей.

Эволюция 3D-генераторов и их интеграция в профессиональный софт

М@cgeventAI-инженер
1 мес

Выход плагинов Magnific для видеоредакторов

М@cgeventAI-инженер
1 мес

Обновление сервиса генерации музыки Sonilo v1.1

Н@GreenNeuralRobotsAI-инженер
1 мес
Sonilo v1.1 Онлайн сервис для генерации музыки В версии 1.1 улучшили создание музыки по видео то есть саундтрека Подстраивает трек под темп и эмоции ролика. • три варианта саундтрека на один клип • сохраняет оригинальную речь в видео • предварительный просмотр аудио до рендера • можно писать посегментный промпт Обучена на лицензированном каталоге Shutterstock. Доступна на fal.ai, в ComfyUI (партнерские ноды) и через API. Коммерческое использование разрешено Музыку по тексту тоже может На примерах где музыка тише - оригинал. Где громче - sonlio 1.1 #text2music #video2music #online

UnityShots: генерация связных видеоисторий на базе LTX-2.3

Н@GreenNeuralRobotsAI-инженер
1 мес
UnityShots Превращает диффузионную модель (LTX-2.3 22B) в инструмент для многокадровых видеоисторий. Генерирует связную последовательность кадров как единый mp4. • сохраняет идентичность персонажа между кадрами • держит постоянство сцены, света, реквизита • синхронно генерирует аудио и липсинк • управляет типами монтажных склеек • три режима инференса: T2V, I2V, R2V • обучение через Shots-Forcing Гитхаб ждем #text2movie #multishot #referencing

Это всё на сейчас.