Разработчик создал ИИ для автоматического поиска фрагментов в видео



Команда Qwen (Alibaba) представила Qwen3.8-Flash — мультимодальную MoEi-модель, а также открыла веса Qwen3.8-Flash-Next, ранней версии архитектуры, которую компания исследует для будущей Qwen4. Модель насчитывает 125B параметров плюс 51B «N-gram»-эмбеддингов, но активирует на токен всего 6B — за счёт этого обучение обошлось примерно в 9 раз дешевле, чем у Qwen3.7-Plus.
По заявленным бенчмаркам модель обходит Qwen3.8-27B и DeepSeek-V4-Flash, а по данным Data Secrets — превосходит Claude Opus 4.6 Max на 8 из 9 тестов. Благодаря компактному числу активных параметров и поддержке GGUF-квантизации модель можно запускать локально на машинах с 128 ГБ памяти (DGX Spark, Mac Studio, Strix Halo), что делает её заметным событием для локального инференса топового уровня качества.
Alibaba выпустила Qwen3.8-Flash-Next — мультимодальную модель с открытыми весами, которая служит ранним предпросмотром архитектуры будущего Qwen4. Модель понимает текст, изображения и видео, при 125 млрд основных параметров активирует лишь 6 млрд на токен, а контекст доведён до 262 144 токенов нативно и почти до 1M через YaRNi.
По словам источников, обучение обошлось примерно в 9 раз дешевле, чем у Qwen3.7-Plus, при этом новая модель обгоняет и Qwen3.7-Plus, и DeepSeek-V4-Flash по большинству бенчмарков — особенно в программировании и офисных задачах. Схема повторяет ход Alibaba с Qwen3-Next перед релизом Qwen3.5: сначала показывают архитектурные новшества, потом строят на них весь модельный ряд.
rls
#lora #realism #krea2 #zimage #qwenimage
VK | MAX
Автор канала «Галера Морева» провёл целый рабочий день, прогоняя модель Qwen 3.8 27B через реальные агентские и разработческие задачи — не синтетические тесты, а боевые проекты.
По плану предполагалась эскалация мощностей: от одной RTX 2080 до пары 2080 и далее до двух RTX 3090, если слабое железо не справится. Но неожиданно все задачи решила самая базовая конфигурация — одна RTX 2080 с квантованием Q4_K_Mi.
Китайская платформа Model Scopei (аналог Hugging Face в Китае) запустила обратный отсчёт до релиза модели Qwen3.8-Flash-Next. Это будет первая модель, построенная на архитектуре следующего поколения, на которой в дальнейшем будет основан и сам Qwen-4.
Деталей пока немного, но известно, что изменения затронут механизм внимания, residual-связиi, эмбеддинг-слоиi и оптимизацию модели — то есть речь о довольно глубокой архитектурной перестройке, а не о косметическом обновлении.
На Hugging Face от аккаунта orcarouter появилось семейство сборок Qwen3.8-27B-Uncensored — версии китайской модели Qwen3.8-27B с ослабленными или снятыми встроенными ограничениями на выдачу контента. За неделю (18–25 августа) вышли варианты под все основные сценарии запуска: MLXi для Apple Silicon (квантование 2/4/6/8 бит), FP8, GGUFi и полная точность BF16, а также готовый API через OrcaRouter для тех, кто не хочет разворачивать модель самостоятельно.
Значимость истории в том, что мощная 27B-модель с рассуждениями, зрением и вызовом инструментов теперь запускается полностью локально, без серверных фильтров и внешнего API — то есть уровень ограничений определяется не платформой, а тем, какую сборку скачал пользователь и как её настроил.
Вышло второе поколение DFlash — техники спекулятивного декодирования для ускорения инференса больших языковых моделей. Первое поколение DFlash уже стало отраслевым стандартом, набрав 3,5 млн загрузок на Hugging Face. Суть подхода: маленькая модель быстро предсказывает кусок текста, а большая проверяет его одним проходом вместо того, чтобы генерировать по слову — итоговый текст полностью идентичен оригиналу, но выдаётся быстрее.
На практике это уже проверили с моделью Qwen3.8-27B: на ноутбуке она выдаёт 70 токенов/с вместо обычных ~15–20, а ускорение достигает 2.7–4.6 раз в зависимости от модели и настроек.

Семейство открытых ИИ-моделей Qweni от Alibaba за последние полгода скачали более 3 млрд раз — это больше, чем модели OpenAI, Google и Meta (запрещена в России) вместе взятые. Qwen вышла на первое место в мире среди решений с открытым исходным кодом, обойдя как западных, так и китайских конкурентов.
В ответ на «парад китайских моделей» Google сообщила, что её открытое семейство Gemmai преодолело отметку в 1 млрд загрузок за два года существования, а сообщество разработчиков опубликовало на его основе более 100 тысяч производных вариантов — впечатляющий показатель, который тем не менее заметно отстаёт от результатов Qwen.

