ИИ
AsyncReasoning: метод асинхронного рассуждения для LLM от Yandex Research
Alibaba анонсировала флагманскую ИИ-модель Qwen3.8
Компания Alibaba представила Qwen3.8 — новую флагманскую модель с 2,4 трлн параметров, которая, по заявлениям разработчиков, уступает по производительности только Claude Fable 5 от Anthropic. Анонс стал оперативным ответом на недавний запуск конкурентной модели Kimi K3 от Moonshot AI.
На текущий момент доступна только предварительная версия Qwen3.8-Max-Preview. Alibaba пообещала в ближайшее время опубликовать полные веса модели в формате open-weighti, что соответствует стратегии поддержки открытых технологий в Китае.
Дайджест ИИ: Alibaba, Moonshot, AMD, ИИ-дрон и фильм Нила Бломкампа
Переход в AI-стартап в режиме stealth
Qualcomm выпустила MobileWan — генерацию видео нейросетью прямо на смартфоне
Qualcomm представила MobileWan — доработанную (затюненную) версию модели WAN2.2 5Bi, способную генерировать видео непосредственно на смартфонах с процессором Snapdragon, без облачных серверов. Модель создаёт 5-секундные ролики в разрешении 480×832 px при 16 кадрах в секунду, затрачивая на генерацию всего 20 секунд.
По заявлению разработчиков, MobileWan показывает рекордный для мобильных решений результат по бенчмарку VBenchi — 83.79 балла, и, судя по материалам официального сайта проекта, превосходит классическую версию Wan 2.2 5B.
Экономика инференса и влияние китайских моделей на рынок ИИ
Сергей Аносов о темпах развития ИИ и стратегии экспериментов
Обновление LTX-2.3-3DREAL-LoRA v2
ИИ-бабушка Daisy против телефонных мошенников
Выход обновления PiD v1.5 для диффузных моделей
Обновление Hermes Agent до версии v0.19.0 Quicksilver
Cursor оптимизировала работу агентов, снизив стоимость в 8 раз
Опыт использования Fable 5 и оркестратора soerdev
Исследование: LLM снижают точность ответов, но повышают уверенность пользователей
Учёные из трёх ведущих университетов провели эксперимент: участникам задавали сложные вопросы (в том числе о деталях фильмов) и разрешали в любой момент ответить «не знаю». Одной группе давали доступ к языковой модели Step 3.5 Flashi — по данным источников, она справлялась с этими вопросами хуже всех.
Результат: с помощью LLMi люди отвечали на больше вопросов, но точность резко упала, а уверенность в своих (часто неверных) ответах выросла. Модель не заполняла пробелы в знаниях, а превращала верные интуитивные догадки и восстанавливаемые из памяти ответы в ошибки.
ВыводПо данным @kyrillic: точность ответов упала с 28% до 9%, уверенность выросла с 30% до 76%
Квантизованные reasoning-модели «переосмысливают» ответы — и это можно вылечить занижением 50 токенов
Команда из Meta исследовала, почему квантизованные reasoning-модели теряют в качестве сильнее, чем модели, квантизованные для обычных задач. Оказалось, что дело не только в потере точности вычислений, а в специфическом эффекте overthinkingi: модель зацикливается в рассуждениях и даже получив верный ответ на промежуточном шаге, в итоге выдаёт другой, ошибочный.
Авторы нашли простой и эффективный способ борьбы с этим: заниженные логиты для 50 вручную отобранных «overthinking-токенов» (вроде «Wait», «But», «Alternatively») одновременно сокращают длину ответа и повышают качество — важный практический результат для тех, кто использует квантизацию reasoning-моделей в проде.
ВыводРассмотрены варианты квантизации: weight-only AWQ и GPTQ в 3 и 4 бита, а также weight+activation+KV-cache квантизация в 4 и 8 бит через FlatQuant