бенчмаркиСбросить фильтр ×

Обзор ключевых трендов и проблем в развитии GenAI

E@ProductsAndStartupsAI-инженер
2 дн

Кризис методологии в современных AI-бенчмарках

Б@boris_againAI-инженер
1 нед

Bloomberg: разрыв между китайскими и американскими AI-моделями практически исчез

Свежая статья Bloomberg приводит график, где сравниваются фронтирные AI-модели Китая и США по взвешенному среднему набору сложных бенчмарков. График показывает, что за последние пару лет разрыв в способностях моделей резко сократился, хотя ещё недавно казался значительным.

Это противоречит заявлениям многих американских лидеров индустрии, которые продолжают говорить об отставании китайских моделей на 6-9 месяцев — судя по данным Bloomberg, эта оценка уже не отражает реальность, особенно если учитывать разницу в цене.

ВыводНа графике оранжевые точки обозначают китайские модели, синие — американские; ломаной линией соединены фронтирные (лучшие на момент выхода) модели

6-9 месяцевзаявляемое США отставание Китая в AI

Полный разбор →

Разбор версий и позиционирования моделей MAI-Image-2.5-Pro и MAI-Image-2.6

М@cgeventAI-инженер
1 нед

Оптимизация ядер с помощью ИИ-агентов: риск подгонки бенчмарков

К@quant_prune_distillAI-инженер
1 нед
Народная мудрость при написании кернелов с помощью агентов.
Фиксируйте бенчмарки самостоятельно, ибо агент всегда сможет под себя так наоптимизировать бенчмарк, чтобы показать выдающиеся цифры по ускорению против бейзлайнов.

Вопрос о производительности квантованных моделей и шине PCI-E

T@extremecodeAI-инженер
1 нед
Эксперты из каментов, я с этими бенчмарками скоро с ума сойду. Почему так ёпта? PCI-E 4 / x4, на ЖПУ также только 4 линии распаяно. В теории должны упираться в шину, какого хрена iMatrix, и уж тем более 8-и битки быстрее, чем очереднярные Q4? Все в интернетах пишут типа, "АРРРЯЯ IQ медленные", какого хрена у меня они стабильно быстрее? Даже на нормальной жпу в pcie5 со всеми линиями (скрин в каменты к посту закину) Параметры бенча дефолтные [--fit-target 1024], контекст 512 на pp, и 128 на tg
Вопрос о производительности квантованных моделей и шине PCI-E

Налог на масштаб в разработке: анализ бенчмарков DX

П@badTechProjectкарьера / HR
1 нед

Опубликован технический отчет по проекту Уроборос

A@abstractDLAI-инженер
2 нед
Опубликовал препринт техрепорта про Уробороса, который писали вместе с Хоуп и Романом Ямпольским. Там можно посмотреть детали про архитектуру Уробороса и Хоуп, подробнее про бенчмарки, гардрейлы и safety. Статья, GitHub, чат с Хоуп
Опубликован технический отчет по проекту Уроборос

Обзор эффективности моделей Luna, Opus 5 и DeepSeek 4 Flash для Code Review

A@ai_drivenAI-инженер
2 нед
Обзор эффективности моделей Luna, Opus 5 и DeepSeek 4 Flash для Code Review

Методика оценки качества квантованных моделей

T@extremecodeAI-инженер
3 нед
Методика оценки качества квантованных моделей

Проверка ИИ-моделей на «пеликанмаксинг»

Х@habr_comмедиа / агрегатор
3 нед
Проверка ИИ-моделей на «пеликанмаксинг»

Агент Ouroboros занял первое место на бенчмарках Terminal Bench, OSWorld и CL-bench

Автор канала AbstractDL сообщил, что его open-source агентный луп Ouroborosi, написанный на чистом Python, вышел в лидеры сразу трёх бенчмарков для AI-агентов — Terminal Bench, OSWorldi и CL-bench, обойдя Codex, Claude code, Cursor и Hermes.

По словам автора, это делает Ouroboros лучшим доступным агентом для ресёрча, работы через терминал, computer use и кодинга одновременно — и с этого момента он переводит всю свою разработку и исследования на этот инструмент.

Полный разбор →

Агент Ouroboros стал лидером на бенчмарках Terminal Bench, OSWorld и CL-bench

L@lovedeathtransformersAI-инженер
4 нед

Как выбирать модели Claude: отказ от бенчмарков

Т@timurtaepovAI-инженер
4 нед
Как выбирать модели Claude: отказ от бенчмарков

OpenAI утроили результат GPT-5.6 Sol на ARC-AGI-3 (13,3%→38,3%), но обогнать Claude Opus 5 это не помогло

OpenAI выяснили, что низкий результат GPT-5.6 Sol на агентном бенчмарке ARC-AGI-3i (всего 7,8% в официальном рейтинге, где лидирует Claude Opus 5 с 30,2%) объясняется не слабостью модели, а стандартным тестовым harnessi'ом. Он после каждого шага удалял приватный ризонинг модели и обрезал историю по скользящему окну — а Sol специально обучена сохранять рассуждения между шагами игры.

Когда OpenAI прогнали Sol через Responses API с сохранением ризонинга и механизмом Compactioni (сжатие контекста вместо удаления — те же настройки, что в продакшене ChatGPT и Codex), результат на публичном сете ARC-AGI-3 подскочил с 13,3% до 38,3%, причём модель потратила в 6 раз меньше выходных токенов. Однако это кастомный харнесс, а не официальные условия теста, поэтому формально Opus 5 (30,2%) по-прежнему считается лидером — прямого превосходства Sol не доказывает.

ВыводСтандартный harness ARC-AGI-3 удаляет весь приватный ризонинг модели после каждого действия в игре

38,3%новый результат Sol с кастомным harness
13,3%старый результат Sol на стандартном harness
30,2%официальный результат Claude Opus 5

Полный разбор →

Ещё ↓