← к ленте

Анонс мультимодальной модели SenseNova-U1.5-8B-MoT

Н@GreenNeuralRobotsAI-инженер
1 нед

SenseTime представила превью мультимодальной модели SenseNova-U1.5-8B-MoT, способной работать с текстом и изображениями в едином трансформере.

Новый подход к архитектуре мультимодальных моделей позволяет эффективнее объединять текст и визуальные данные.

  • Отказ от классических компонентов (VAE, DiT) упрощает архитектуру модели.
  • Нативная поддержка 4K-разрешения и улучшенный рендер текста повышают качество генерации.
  • Модель демонстрирует высокую точность в редактировании изображений и понимании сложных промптов.
SenseNova-U1.5-8B-MoT Превью мультимодалки от SenseNova. Полную ждем Понимание и генерация картинок в одном трансформере. Никакого VAE, текстового энкодера и DiT - Текст и картинка используют разные веса в смеси трансформеров, но аттендят друг на друга - Нативный 4K - Уверенный рендер текста на китайском и английском - Точное редактирование - Понимает структурированные длинные промпты без отдельного обучения - на Qwen-Image Bench - уровень Nano Banana 2 - на ImgEdit-Bench и GEdit-Bench обходит Nano-Banana и Qwen-Image-2 Гитхаб HF Есть 8-шаговая лора Попробовать Comfyui #4k #vlm #imageediting VK | MAX

Кратко (AI)

Компания SenseTime анонсировала мультимодальную модель SenseNova-U1.5-8B-MoT, которая объединяет понимание и генерацию изображений в рамках одного трансформера без использования VAE или отдельных текстовых энкодеров. Модель поддерживает нативное разрешение 4K, качественный рендер текста и точное редактирование изображений, показывая конкурентные результаты в бенчмарках.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖