← к ленте

Kimi K3: новый конкурент западным LLM-флагманам

1 мес

Анализ производительности новой модели Kimi K3, которая показывает результаты на уровне топовых западных LLM в бенчмарках и Frontend Code Arena.

Kimi K3 может стать моментом DeepSeek 2.0 Первые бенчмарки выглядят очень сильно. Kimi K3 уже называют моделью, которая сокращает разрыв между китайскими open-weight моделями и закрытыми флагманами США. FT пишет, что K3 должна превзойти Opus 4.8 в ряде бенчмарков, но при этом всё ещё не дотягивает до закрытой Fable. Opus 4.8 вышла в конце мая, Anthropic позиционировала её как заметное обновление для agentic-задач, reasoning и работы с инструментами. Если Kimi K3 действительно обходит её в части тестов, тезис «Китай стабильно отстаёт на 6–8 месяцев» становится всё слабее. Отдельно Kimi-K3 уже вышла на первое место в Frontend Code Arena с 1679 pts, обойдя Claude Fable 5. В frontend она стала №1 в 6 из 7 доменов: Brand & Marketing, Reference-Based Design, Data & Analytics, Consumer Product, Simulations и Content Creation Tools. Конечно, бенчмарки ещё нужно проверять реальным использованием: coding agents, большие репозитории, 3D, интерфейсы, долгие задачи, стабильность и цена. Китайские модели всё ближе к frontier-уровню американских закрытых. Kimi K3 - не Fable и не Mythos. Но она уже слишком близко к топовым западным моделям, чтобы относиться к ней как к «ещё одной open model». kimi.com/code/docs/en/kimi-code/models

Кратко (AI)

Новая модель Kimi K3 демонстрирует высокие результаты в бенчмарках, приближаясь к уровню ведущих западных моделей, таких как Opus 4.8. Модель заняла первое место в Frontend Code Arena, что ставит под сомнение тезис об отставании китайских разработок от американских аналогов.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖