Обзор возможностей модели Qwen 3.0 image
М@cgeventAI-инженер
1 месАнализ новой модели генерации изображений Qwen 3.0: возможности работы с текстом, инфографикой и вопросы к открытости разработки.
Новый Qwen 3.0 image
Qwen 3 переваривает инструкции длиной до 4500 токенов, умеет верстать плотные инфографики, интерфейсы, газетные полосы, схемы и даже страницы научных работ с формулами.
Главная заявка - разборчивый текст размером вплоть до 10 пикселей, 12 языков и более 20 шрифтов. То есть генераторы изображений наконец пытаются конкурировать не только с художниками.
Заметили, как все набросились на инфографику?
Судя по черрипикам, модель удерживает (в теории) сложную композицию и множество текстовых блоков в одном кадре.
Но!
Весов, технического отчета, лицензии и нормальных независимых тестов на старте нет. Пока нам показали очень красивые картинки и попросили поверить на слово.
Также есть информация, что трешку тренировали на синтетике из GPT image 2 (вот откуда инфографика)
Но 2.
Они не оперсорснули 2602 и 2604 для версии 2. И похоже сворачивают опенсорс лавочку. Нехорошо-с.
Первые тесты генерации текста также довольно кривые.
https://qwen.ai/blog?id=qwen-image-3.0
Доступ через API.
@cgevent
Кратко (AI)
Вышла новая модель Qwen 3.0 image, способная генерировать сложные изображения с текстом, включая инфографику и научные схемы. Автор отмечает высокое качество работы с мелкими деталями, но критикует отсутствие открытых весов и независимых тестов, а также возможную зависимость от синтетических данных GPT image 2.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖