https://artificialanalysis.ai/agents/search-api
Нас (Keenable) сравнили в бенчмарке Artificial Analysis.
Во-первых, я очень рад, что мы туда вообще попали. За это ребятам огромное спасибо.
Во-вторых, с методологией бенча есть некоторые проблемы:
1. Fetch инструмент использовался один на все движки, и это был просто HTTP GET. То есть часть силы нашего индекса была помножена на ноль, потому что часть документов, которые мы возращаем обычным HTTP GET тупо не качается.
2. Две трети оценки складывается из старых публичных бенчмарков (BrowseComp и DeepSearchQA). Все наши конкуренты уже успели их забенчмаксить. Это очень хорошо видно на Parallel Turbo на приватном AA-Omniscience. Это мы поправим, добенчмаксим тоже.