← к ленте

Обзор возможностей модели Qwen 3.0 image

М@cgeventAI-инженер
1 мес

Анализ новой модели генерации изображений Qwen 3.0: возможности работы с текстом, инфографикой и вопросы к открытости разработки.

Новый Qwen 3.0 image Qwen 3 переваривает инструкции длиной до 4500 токенов, умеет верстать плотные инфографики, интерфейсы, газетные полосы, схемы и даже страницы научных работ с формулами. Главная заявка - разборчивый текст размером вплоть до 10 пикселей, 12 языков и более 20 шрифтов. То есть генераторы изображений наконец пытаются конкурировать не только с художниками. Заметили, как все набросились на инфографику? Судя по черрипикам, модель удерживает (в теории) сложную композицию и множество текстовых блоков в одном кадре. Но! Весов, технического отчета, лицензии и нормальных независимых тестов на старте нет. Пока нам показали очень красивые картинки и попросили поверить на слово. Также есть информация, что трешку тренировали на синтетике из GPT image 2 (вот откуда инфографика) Но 2. Они не оперсорснули 2602 и 2604 для версии 2. И похоже сворачивают опенсорс лавочку. Нехорошо-с. Первые тесты генерации текста также довольно кривые. https://qwen.ai/blog?id=qwen-image-3.0 Доступ через API. @cgevent

Кратко (AI)

Вышла новая модель Qwen 3.0 image, способная генерировать сложные изображения с текстом, включая инфографику и научные схемы. Автор отмечает высокое качество работы с мелкими деталями, но критикует отсутствие открытых весов и независимых тестов, а также возможную зависимость от синтетических данных GPT image 2.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖