← к ленте

Методы оптимизации скорости работы LLM

E@ProductsAndStartupsAI-инженер
1 мес

Практические советы по ускорению работы LLM: от выбора моделей и настройки промптов до управления кэшем и токенами.

Недавно нужно было оптимизировать скорость выполнения разных LLM задачек —> что сработало: 1) Переход на модели поменьше - с подкручиванием промптов, в том числе сократить/выключить reasoning. Кстати, идеальная задача для /goal команды: просите крутить промпты, пока не получите оптимальное соотношение скорости и качества 2) Сократить обьем output, а потом и input токенов - более компактная структура, выкидывание ненужного 3) У gemini есть настройка приоритета; но вызов тогда стоит в ~2 раза дороже 4) Анализ использования кэша —> фикс промптов и последовательности подачи контекста P.S. Классические вещи типа параллелизации запросов я не покрываю тут; здесь скорее llm specific вещи

Кратко (AI)

Автор делится практическими методами оптимизации скорости выполнения задач с использованием LLM. Основные рекомендации включают переход на более компактные модели, сокращение объема входных и выходных токенов, использование настроек приоритета в Gemini и оптимизацию кэширования контекста.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖