Alibaba представила новую версию модели генерации изображений Qwen-Image 3.0. Главное отличие — длина промптiа выросла до 4500 токенiов (против 1000 у версии 2.0, то есть в 4,5 раза), что позволяет давать модели почти техническое задание с описанием структуры, текста, стиля и верстки. Модель научилась за один запрос собирать сложные инфографики, интерфейсы, газетные полосы, слайды, страницы научных работ с формулами и математические материалы.
Особое внимание уделили генерации мелкого текста — модель разборчиво рисует текст размером от 10 пикселей, поддерживает более 20 шрифтов и 12 языков (есть ли русский — неизвестно). Улучшили и фотореализм: передачу текстур кожи, тканей, пор и волосков. Однако релиз вышел без весов, кода, технического отчёта и независимых тестов — только черрипикиi от самой Alibaba, что нарушает традицию серии Qwen выпускать открытые веса и отчёт «день в день» с релизом.
- Модель удерживает порядок в сетке 3×3 без «склейки» элементов; по данным NEURO-AI, сетка из девяти разных иллюстраций собирается по одной инструкции на 3700 токенов
- Модель поддерживает более 100 стилей, умеет рисовать LaTeX-формулы, добавлять рукописные пометки и реставрировать старые картины (по данным Нейронавт)
- Модель умеет рендерить погодный график для конкретного города и даты, подтягивая данные из сети (по данным NEURO-AI)
- По данным Метаверсище и ИИще, Qwen 3.0 тренировали на синтетических данных из GPT image 2 — отсюда, предположительно, акцент на инфографику
- Прошлые версии серии Qwen выходили с открытыми весами, а предыдущий флагман команда сама поставила на пятое место в собственном бенчмарке (по данным NEURO-AI); версии 2602 и 2604 не были опенсорснуты
- По данным Метаверсище и ИИще, первые тесты генерации текста выглядят довольно кривыми, несмотря на заявленную разборчивость от 10 px
- Доступ на старте: по данным источника 1 — через Alibaba Cloud и Qwen AI с обещанием позже добавить бесплатное тестирование в Qwen Studio и приложении Qwen; по данным источника 3 — через API; по данным источника 2 — только через Чат
Пока нет весов, технического отчёта и независимых бенчмарков — оценка возможностей модели строится только на черрипиках Alibaba; стоит следить, появятся ли открытые веса (как у предыдущих версий серии) и независимые тесты качества генерации текста.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖