← к ленте

Бенчмарк Deepseek V4 Flash 0731: эффективность и позиционирование

L@llm_under_hoodAI-инженер
3 нед

Анализ производительности и стоимости новой версии модели Deepseek V4 Flash 0731 в агентских задачах.

Появление новых эффективных моделей снижает стоимость разработки сложных ИИ-агентов.

  • Deepseek V4 Flash 0731 оптимизирована для кодинга и reasoning-задач.
  • Модель демонстрирует высокую эффективность в агентских сценариях, конкурируя с лидерами рынка.
  • Разработчики получают больше качественных открытых инструментов для создания ИИ-решений.
Бенчмарк Deepseek V4 Flash 0731 - попадание на Парето-фронтир по стоимости Новая версия Deepseek V4 стала получше своего предшественника. Возможно, там что-то подкрутили с reasoning, т.к. бенчмарк новой версии работал в 2.5 раза дольше и потратил больше денег. Но это стоило того, т.к. по соотношению цена/качество в долгоиграющих агентских задачах эта модель попала на Pareto-фронтир рядом с gpt-oss-120b Deepseek V4 - это Mixture-of-experts (разреженная) модель с 284B параметров, из которых активируются 13B. В версии от конца июля заново прогнали post-train, чтобы заточить ее больше на "coding, reasoning, and agent workflows". Модель можно выкачать и запустить. Правда, старушку gpt-oss-120B она пока не сильно подвинула (последняя занимает еще и фронтир по скорости). Но, если смотреть как фронтир потихоньку ползет все дальше от начала координат, остается только очень радоваться за скорость прогресса. Появляется все больше хороших и открытых моделей под разные задачи! Ваш, @llm_under_hood 🤗
Бенчмарк Deepseek V4 Flash 0731: эффективность и позиционирование

Кратко (AI)

Автор анализирует новую версию модели Deepseek V4 Flash 0731, отмечая её улучшенные способности в кодинге и агентских задачах. Несмотря на возросшие затраты ресурсов, модель достигла Парето-фронтира по соотношению цена/качество, конкурируя с gpt-oss-120b.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖