диффузионные моделиСбросить фильтр ×

Yandex Research и ШАД выложили в открытый доступ курс по генеративным моделям в компьютерном зрении

Yandex Research совместно с преподавателями ШАД опубликовали материалы курса «Генеративные модели в компьютерном зрении» — Visual GenAI. Курс посвящён современным подходам к генерации изображений, видео и 3D-контента, с упором на диффузионные моделиi.

Материалы рассчитаны на тех, кто уже знает базу генеративных моделей и хочет разобраться, что сейчас происходит в research и R&D по этому направлению — вплотную к тому, что применяется в индустрии.

Полный разбор →

Курс по генеративным моделям в компьютерном зрении от Yandex Research и ШАД

M@mashkka_dsAI-инженер
3 нед
Курс по генеративным моделям в компьютерном зрении от Yandex Research и ШАД

Google DeepMind представили CO2Jump — training-free сэмплер для генеративных моделей

Н@GreenNeuralRobotsAI-инженер
1 мес
CO2Jump training‑free сэмплер от Google DeepMind, текст и изображение корректируют друг друга в процессе генерации. Обычно в диффузионных моделях генерация идёт либо из текста в картинку, либо из картинки в картинку. В CO2Jump два потока (текст и изображение) работают параллельно и на каждом шаге обмениваются информацией, взаимно улучшая результат. При этом модель не нужно дообучать: метод встраивается поверх уже существующих моделей. Дает хорошие результаты на редактировании изображений и решении визуальных головоломок Код ждем #t2i #sampler

LongE2V: восстановление видео на основе событий

Н@GreenNeuralRobotsAI-инженер
1 мес
LongE2V Восстанавливает, предсказывает и интерполирует видео на основе событий по низкокачественным видеопотокам с датчиков событий. Тянет длинные временные горизонты, где обычные методы буксуют. Строится на видео-диффузионных моделях. Сжимает временные зависимости, не теряет детали на длинных отрезках. Похоже что это лора на CogVideoX-5b-I2V Гитхаб #frameinterpolation #v2v

Российские учёные представили на ICML 2026 метод G-Star+ для ускоренной и более точной генерации текста и кода

Исследователи из лаборатории научных исследований Т-Технологий и Института ИИ и цифровых наук ФКН НИУ ВШЭ разработали метод G-Star+ (Guided Star-Shaped sampleri) — «внутренний редактор» для моделей маскированной диффузии, которые генерируют текст и код. Работу представили на конференции ICML 2026i в Сеуле.

Проблема таких моделей в том, что уже размаскированный токен фиксируется навсегда: если модель ошиблась на раннем шаге, исправить это позже нельзя, и текст просто дописывается вокруг ошибки. G-Star+ решает это без полного переобучения модели — достаточно дообучить один дополнительный слой, который находит подозрительные токены, повторно маскирует их и даёт модели переписать позже.

ВыводМетод получил название G-Star+ (Guided Star-Shaped sampler); все зашумлённые состояния зависят только от чистого текста, а не друг от друга — на каждом шаге модель предсказывает полную чистую последовательность, и следующее состояние сэмплируется заново

64–256 шаговрежим быстрой генерации, где метод эффективен
3.4 против 9.2 секундывремя генерации на H200 (128 vs 512 шагов)
семи бенчмаркахчисло тестов, на которых оценивали метод

Полный разбор →

OrbitQuant: метод калибровки без данных для квантования диффузионных моделей

Н@GreenNeuralRobotsAI-инженер
1 мес
OrbitQuant метод калибровки без данных (calibration‑free) для посттренировочной квантизации (PTQ) диффузионных генераторов изображений и видео • новая #SOTA на FLUX.1, Wan 2.1 и CogVideoX при W4A4 (4 бита для весов, 4 бита для активаций) • рабочие изображения на W2A4, где старые методы ломаются Код / веса не выложили пока #optimization #t2i #t2v #flux #wan21 #zimage

Это всё на сейчас.