← к ленте

Разработка бенчмарка для агентных LLM

L@llm_under_hoodAI-инженер
1 мес

Автор разрабатывает бенчмарк для оценки качества, стоимости и скорости работы агентных архитектур при смене LLM.

Прообраз Agentic LLM Бенчмарка Задачи туда я добавляю на основе анализа работы и ошибок топовых архитектур агентов из BitGN. Бенчмарк отвечает на вопрос - а в какую сторону изменятся качество, стоимость и скорость работы моего агента, если я возьму топовую архитектуру и пересажу ее на другую LLM? Задач пока загружено ~50% от минимально необходимого набора. Колонки и категории появятся потом, но уже есть оценка времени (берется медианное время) и стоимости. Если у модели есть значок молнии, значит она запускалась у компании с AI Акселератором (Groq или Cerebras). Какие нынче еще есть топовые модели, которые вы реально используете в продуктовых решениях в своих компаниях по API? Ваш, @llm_under_hood 🤗

Кратко (AI)

Автор создает бенчмарк для оценки производительности агентных архитектур при использовании различных LLM. Инструмент позволяет анализировать изменения качества, стоимости и скорости работы агентов, а также учитывает использование ускорителей вроде Groq и Cerebras.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖