← к ленте

Keenable о методологии бенчмарка Artificial Analysis

С@senior_augurAI-инженер
1 нед

Разбор методологии бенчмарка Artificial Analysis от команды Keenable: проблемы с инструментом Fetch и использование устаревших публичных тестов.

Бенчмарки для AI-агентов часто не учитывают специфику работы поисковых движков.

  • Универсальные инструменты тестирования могут нивелировать преимущества специализированных поисковых индексов.
  • Использование публичных датасетов в бенчмарках приводит к их «зазубриванию» моделями, что искажает реальные показатели качества.
  • Разработчикам AI-решений важно критически оценивать внешние тесты, так как методология может не отражать реальные возможности продукта.
https://artificialanalysis.ai/agents/search-api Нас (Keenable) сравнили в бенчмарке Artificial Analysis. Во-первых, я очень рад, что мы туда вообще попали. За это ребятам огромное спасибо. Во-вторых, с методологией бенча есть некоторые проблемы: 1. Fetch инструмент использовался один на все движки, и это был просто HTTP GET. То есть часть силы нашего индекса была помножена на ноль, потому что часть документов, которые мы возращаем обычным HTTP GET тупо не качается. 2. Две трети оценки складывается из старых публичных бенчмарков (BrowseComp и DeepSearchQA). Все наши конкуренты уже успели их забенчмаксить. Это очень хорошо видно на Parallel Turbo на приватном AA-Omniscience. Это мы поправим, добенчмаксим тоже.
Keenable о методологии бенчмарка Artificial Analysis

Кратко (AI)

Команда Keenable прокомментировала свое появление в бенчмарке Artificial Analysis. Разработчики указали на недостатки методологии, в частности на ограничение инструмента Fetch и использование устаревших публичных наборов данных, которые конкуренты уже оптимизировали.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖