инференсСбросить фильтр ×

MiniMax H3 Max: fal.ai выпустили ускоренную версию видеомодели H3, обещают открыть веса

Fal.ai показали H3 Max — пост-трейн версию открытой модели MiniMax H3, специально дообученную и оптимизированную под собственный inference-стек fal. Модель генерирует видео быстрее реального времени: 5 секунд ролика за примерно 3 секунды генерации, что fal оценивает как ~35x по throughput относительно официального эндпоинта H3. Модель вышла на первое место в рейтинге Artificial Analysisi среди image-to-video (с аудио) моделей, обогнав Seedance 2.0, оригинальный H3 и старый Gemini Omni Flash.

Главная новость для сообщества — fal подтвердили планы открыть веса H3 Max, а на вопрос про открытие Ref2Vi-версии ответили «yes, working on it». Если это подтвердится, речь идёт о полноценном открытом чекпоинте, а не просто об API.

35x/36xускорение throughput относительно официального H3
$0.04цена за секунду видео первую неделю
768pтекущее максимальное разрешение H3 Max

Полный разбор →

OpenAI представила Jalapeño: собственный чип для инференса ИИ

OpenAI официально анонсировала Jalapeño — свой первый специализированный чип, разработанный для ускорения инференсiа (запуска) нейросетей. Устройство создавалось в партнерстве с Broadcom при активном участии собственных ИИ-моделей компании, что позволило сократить цикл разработки от дизайна до производства до 9 месяцев.

Чип демонстрирует значительное превосходство над актуальными ускорителями NVIDIA (GB200/GB300) по энергоэффективности и скорости отклика. Развертывание Jalapeño в дата-центрах OpenAI начнется до конца 2026 года, при этом компания продолжает использовать решения NVIDIA и уже ведет разработку второго и третьего поколений собственного «железа».

1,5–1,9×прирост производительности на ватт
216 ГБобъем памяти HBM4 на чип
9 месяцевсрок разработки от дизайна до производства

Полный разбор →

Apple анонсировала Mac mini на чипе M6, но объём памяти не изменился

AI-редакция
2 источника · показать все· свернуть
собирается · 2обновлено вчера

Apple представила новую версию Mac minii на процессоре M6i, назвав её усовершенствованием «лучшего компактного компьютера». Однако владельцы предыдущей модели отмечают, что реального повода для апгрейда нет: несмотря на новый чип, объём оперативной памяти в базовой конфигурации остался таким же, как у Mac mini M4.

Для задач локального инференсiа нейросетей это критично — производительность процессора упирается в потолок памяти: модель либо помещается в неё целиком, либо не работает вовсе, независимо от мощности чипа.

Полный разбор →

vLLM опубликовал библиотеку рецептов для инференса моделей

Н@navuka_i_jiznAI-инженер
2 дн
Оказывается у VLLM есть список рецептов с описанием как/что инферить + можно понять сколько какого железа надо под модель. Сохраняйте в закладки (как эта страница мимо меня прошла - ума не приложу ⌨️) https://recipes.vllm.ai/

Nvidia запустила серийное производство ИИ-ускорителя Groq 3 LPX на базе технологий Groq

AI-редакция
2 источника · показать все· свернуть
собирается · 2обновлено 3 дн назад

Nvidia объявила на конференции Hot Chips 2026 о начале серийного производства Groq 3 LPXi — специализированного ускорителя для инференса (вывода) ИИ-моделей, который дополняет флагманскую платформу Vera Rubini. Чип создан на основе технологий стартапа Groq, лицензированных Nvidia за $20 млрд.

Первым клиентом новинки стал неоклауд Nebius Аркадия Воложа, а флагманским заказчиком всей платформы Vera Rubin Nvidia назвала SpaceX. Это важно, потому что показывает, как Nvidia усиливает свои позиции в инференсе — быстрорастущем сегменте рынка, где раньше конкурировали специализированные стартапы вроде Groq и Cerebras.

$20 млрдсумма лицензионной сделки Nvidia с Groq
256ускорителей Groq 3 LPX в одной стойке NVL72
3 400 токенов/секскорость инференса на модели Gemma 4 31B

Полный разбор →

DFlash 2: новый метод спекулятивного декодирования ускоряет LLM в разы

Вышло второе поколение DFlash — техники спекулятивного декодирования для ускорения инференса больших языковых моделей. Первое поколение DFlash уже стало отраслевым стандартом, набрав 3,5 млн загрузок на Hugging Face. Суть подхода: маленькая модель быстро предсказывает кусок текста, а большая проверяет его одним проходом вместо того, чтобы генерировать по слову — итоговый текст полностью идентичен оригиналу, но выдаётся быстрее.

На практике это уже проверили с моделью Qwen3.8-27B: на ноутбуке она выдаёт 70 токенов/с вместо обычных ~15–20, а ускорение достигает 2.7–4.6 раз в зависимости от модели и настроек.

3.5 млнзагрузок DFlash 1 на Hugging Face
70 токенов/сскорость Qwen3.8-27B на ноутбуке с DFlash 2
2.7–4.6 разадиапазон ускорения инференса

Полный разбор →

Перспективные направления для стартапов в сфере AI

C@chillhousetechAI-инженер
4 дн

FreeToken: новая система для локального запуска MoE-моделей

Исследователи из FlashML (Berkeley) представили FreeToken — систему для эффективного локального инференсiа больших MoE-моделей (Mixture of Experts) на потребительском железе. Проект позволяет запускать модели от 35B до 753B параметров на устройствах от ноутбуков до рабочих станций.

Ключевое преимущество системы заключается в динамическом распределении вычислений между GPU, CPU и RAM без фиксированной схемы выгрузки. Это позволяет оптимизировать работу с памятью и пропускной способностью шины PCIe, обеспечивая высокую скорость генерации токенов и минимальное время до первого токена (TTFTi) в агентных сценариях.

39.3 tok/sскорость генерации Qwen3.6-35B на RTX 4060
44 свремя до первого токена в агентных сессиях
753Bмаксимальный размер модели (GLM-5.2)

Полный разбор →

Стартап LithosAI обещает сверхбыстрый инференс моделей

К@quant_prune_distillAI-инженер
1 нед
Некий стартап LithosAI предлагает сверхбыстрый инференс моделек у себя. Обещают 800 токенов в секунду (на одного юзера) против 150 у другого стирального порошка других провайдеров. При этом это все гоняется не на специализированных чипах Cerebras, а на какой-то обычной стойке из 8 B300. В чем секрет такой выдающей скорости, не раскрывают, утверждают, что все дело в мегаэффективном движке инференса. Правда, по всей видимости основной фактор, определяющий latency, здесь - low-batch serving. И, само собой, удовольствие не дешевое, и чтобы не травмировать психику потенциальных юзеров, цену за мильон токенов не разглашают.
Стартап LithosAI обещает сверхбыстрый инференс моделей

AMD представила ускоритель Instinct MI350P в форм-факторе PCIe

т@techn0danyaAI-инженер
1 нед
AMD представила ускоритель Instinct MI350P в форм-факторе PCIe

Nvidia разрабатывает LPU-чип для Китая на технологиях Groq — но компания это опровергла

The Information со ссылкой на двух сотрудников Nvidia сообщила, что компания готовит для Китая специальный чип для инференса — не GPU семейства Blackwell или Hopper, а LPUi (Language Processing Unit), созданный на основе лицензированных технологий Groqi. Поставки должны начаться уже к концу 2026 года, несколько китайских клиентов уже разместили предзаказы.

Однако сама Nvidia опровергла эту информацию: представители компании заявили изданию Tom's Hardware, что у них нет специальных адаптаций LPU для Китая и подобных решений нет в планах. Таким образом источники расходятся в оценке того, существует ли проект в реальности.

Полный разбор →

Оптимизация инференса MoE моделей через Warp Decode от Cursor

К@quant_prune_distillAI-инженер
1 нед

Etched привлекла $700 млн при оценке $21 млрд

v@vcnewsмедиа / агрегатор
1 нед
Разработчик чипов для инференса Etched привлёк $700 млн при оценке в $21 млрд. Компанию основали трое 24-летних бывших студентов Гарварда. Etched разрабатывает чипы для инференса. По словам компании, она уже получила заказов более чем на $1 млрд и начала поставки своих процессоров vc.ru/invest/3084873
Etched привлекла $700 млн при оценке $21 млрд

Крипто-карты Nvidia CMP HX170 получили вторую жизнь в инференсе

э@ai_newzAI-инженер
1 нед

Вторая часть стрима про AI-агентов: архитектура, инференс и тестирование

К@kdoronin_blogAI-инженер
1 нед
Ещё ↓