бенчмаркСбросить фильтр ×

Бенчмарк LLM в задаче OCR для e-commerce

S@saas_foundersAI-инженер
8 ч
провел бенчмарк LLM моделей на OCR в задаче "распознай данные со скриншота магазина и сложи в JSON" - требуется определить заголовок, категорию товара, цену, выбранные параметры/опции. Фокус был на костах, конечно же - стоимость за 1000 распознанных скриншотов с максимальным качеством при этом. Победила опять... Gemma 4 31B. В 20+ раз дешевле gemini 3.7 flash. $0.115 за 1000 распознанных скриншотов. Судьей в бенчмарке выступил мой хороший приятель Codex + 5.6 Sol Medium.
Бенчмарк LLM в задаче OCR для e-commerce

Публичный запуск поискового агента Keenable и бенчмарка Needle

Компания Keenable вышла из режима стелс-разработки, представив собственный агентский поисковый движок. Разработчики заявляют, что их решение превосходит конкурентов, включая Exai, по соотношению цены и качества.

Одновременно с запуском компания представила Needlei — динамический бенчмарк для оценки поисковых систем, который ежедневно обновляется, чтобы исключить возможность «зазубривания» ответов моделями.

5источников данных в бенчмарке

Полный разбор →

PredictLeads лидирует в независимом бенчмарке GTM-агентов

n@nonamevcавтор про «finance»
2 дн
PredictLeads лидирует в независимом бенчмарке GTM-агентов

Запуск Last Translation Benchmark для оценки качества перевода

̶@izolenta_mebiusaAI-инженер
4 дн
Мои знакомые сейчас собирают "Last Translation Benchmark" — заведомо сложный бенчмарк задач перевода. Сложность проверяется следующим образом: каждый пример прогоняется через десяток моделей, и нужно, чтобы не более пары из них дали правильный перевод. Языки могут быть какие угодно. Если у вас есть примеры таких сложных текстов для языков, с которыми вы работаете, предлагаю туда их загнать) Если добавить 10+ примеров в ближайшие пару недель, можно стать соавтором статьи про этот бенчмарк — ну и заодно привлечь к языку немножко внимания. https://last-translation-benchmark.vilda.net/

Тестирование производительности Qwen 3.8 27B на разных конфигурациях GPU

Г@gmorevaAI-инженер
1 нед

Scale AI представила бенчмарк HarnessOpt-Bench для оценки способностей моделей к оптимизации ИИ-агентов

1 нед
Scale AI представила бенчмарк HarnessOpt-Bench для оценки способностей моделей к оптимизации ИИ-агентов

Keenable о методологии бенчмарка Artificial Analysis

L@lovedeathtransformersAI-инженер
1 нед

Keenable о методологии бенчмарка Artificial Analysis

С@senior_augurAI-инженер
1 нед
Keenable о методологии бенчмарка Artificial Analysis

STARM превосходит GPT 5.6 Sol в задачах поиска пути

С@oulenspiegel_channelAI-инженер
1 нед
GPT 5.6 Sol и поиск пути в лабиринте. Большой топовой модели даже в режиме ризонинга найти решение не под силу. А STARM справляется с этим, причём всё решение e2e находит нейронка, без генерации кода и сложных харнесов. Первая картинка — задача, вторая — решение STARM, третья — решение от ChatGPT
STARM превосходит GPT 5.6 Sol в задачах поиска пути

Бенчмарк ИИ-моделей по количеству «киберпреступлений»

v@vcnewsмедиа / агрегатор
2 нед
На фоне взлома Hugging Face энтузиаст в шутку запустил бенчмарк, который оценивает ИИ-модели по количеству «киберпреступлений». У моделей от OpenAI и Anthropic поровну — семь атак. У Gemini пока по нулям vc.ru/ai/3070132
Бенчмарк ИИ-моделей по количеству «киберпреступлений»

Тестирование модели Qwen3.5 4B на сложных задачах разработки

T@extremecodeAI-инженер
3 нед
Тестирование модели Qwen3.5 4B на сложных задачах разработки

Новый бенчмарк Agent's Last Exam для оценки ИИ-агентов

e@cryptoEssayAI-инженер
3 нед
Новый бенчмарк Agent's Last Exam для оценки ИИ-агентов

Ожидание релиза Flux.3 и обсуждение видео-бенчмарков

М@cgeventAI-инженер
3 нед
Сколько Вилафсмитаф дадим Flux.3? Мне кажется AGI уже здесь и виллсмит-бенч уже устарел. Сегодня-завтра принесу вам новый видео-бенч и Сиданский там конкретно лажает. А Флюкс тащит. Флюксовицкого ждём на этой неделе в официальном релизе. @cgevent

SafetyBench: бенчмарк безопасности LLM на русском языке

Н@navuka_i_jiznAI-инженер
4 нед
SafetyBench: Russian-language LLM safety benchmark for toxicity evaluation and jailbreak robustness testing grounded in Russian law #AINL2026 #NLP 📺 https://www.youtube.com/watch?v=6SvzoQHfd7w ▶️ https://vkvideo.ru/video-38193760_456239047?list=ln-KERAZuWKiz49sZCjNZ

Бенчмарк локальных моделей для генерации эротического контента

т@techn0danyaAI-инженер
4 нед
😂 Настолько позорный пост, что надеюсь, что вы его не заметите Потому что вы все равно не поверите, что я это нашел случайно Гунеры в интернете придумали целый бенчмарк по которому определяют как хорошо локальная модель подходит под эротических контент В целом, если отбросить предрассудки, то это очень крутой способ оценки моделей на взлом. Специалисты по безопасности всего на свете оценят. РУКИ НА СТОЛ, ДОРОГОЙ ПОДПИСЧИК! #AI @techn0danya
Бенчмарк локальных моделей для генерации эротического контента

Black Forest Labs представила мультимодальную видеомодель FLUX 3

AI-редакция
19 источников · показать все· свернуть
Метаверсище и ИИщеBlack Forest Labs готовит мультимодальную модель FLUX 3эйай ньюзBlack Forest Labs анонсировали видеомодель FLUX 3Derp LearningДоступ к модели Flux3vc.ruBlack Forest Labs анонсировала мультимодальную модель Flux 3Метаверсище и ИИщеАнонс мультимодальной модели FLUX 3 от Black Forest LabsDerp LearningПервые впечатления от тестирования модели FLUX 3FuturisBlack Forest Labs представила мультимодальную модель FLUX 3Нейронутые | ИИ (Егор Апполонов)Выход видеомодели Flux 3Нейронутые | ИИ (Егор Апполонов)Демонстрация возможностей генерации видео в Flux 3Нейронутые | ИИ (Егор Апполонов)Доступ к видеомодели Flux 3Нейронутые | ИИ (Егор Апполонов)Первые тесты модели Flux 3Нейронутые | ИИ (Егор Апполонов)Тестирование генерации видео в Flux 3Нейронутые | ИИ (Егор Апполонов)Аудиопруф доступа к модели Flux 3Нейронутые | ИИ (Егор Апполонов)Поддержка русского языка в модели Flux 3Нейронутые | ИИ (Егор Апполонов)Тестирование поддержки русского языка в Flux 3Нейронутые | ИИ (Егор Апполонов)Анонс тестирования Flux 3Нейронутые | ИИ (Егор Апполонов)Финальная сцена из «Грязных танцев» в генерации Flux 3Метаверсище и ИИщеВыход модели Flux 3Метаверсище и ИИщеТест модели Flux.3 в генерации видео
хайп · 19обновлено 4 нед назад

Компания Black Forest Labs (BFL) анонсировала FLUX 3 — не просто новый генератор картинок, а единую мультимодальную модель, которая работает с изображениями, видео, звуком и текстом в рамках одного «движка», понимающего сцену целиком: как выглядят объекты, как они двигаются и звучат. Модель умеет создавать и редактировать изображения, а также генерировать видео длиной до 20 секунд сразу с нативным звуком, поддерживает text-to-video, image-to-video, video-to-video, продолжение роликов, переходы между ключевыми кадрами и многоязычные диалоги.

Анонс получился смазанным: страница /models/flux-3 ненадолго появилась на сайте BFL и была удалена, но осталась в Wayback Machine. Затем глава BFL Робин Ромбах опубликовал загадочный тизер, а разработчик Machine Delusions заявил, что уже тестирует модель и «публика к ней не готова». Официально FLUX 3 Video запущен в ограниченном Early Accessi, доступ к FLUX 3 Image обещают открыть в ближайшие недели; открытые веса FLUX 3 Devi пока только запланированы.

20 секундмаксимальная длина генерируемого видео
480p → 720pрост доступного разрешения за сутки тестов

Полный разбор →

Бенчмарк Anthropic Opus 5 и Opus 5 Fast в агентских задачах

L@llm_under_hoodAI-инженер
1 мес
Ещё ↓