Методы оптимизации скорости работы LLM
E@ProductsAndStartupsAI-инженер
1 месПрактические советы по ускорению работы LLM: от выбора моделей и настройки промптов до управления кэшем и токенами.
Недавно нужно было оптимизировать скорость выполнения разных LLM задачек —> что сработало:
1) Переход на модели поменьше - с подкручиванием промптов, в том числе сократить/выключить reasoning. Кстати, идеальная задача для /goal команды: просите крутить промпты, пока не получите оптимальное соотношение скорости и качества
2) Сократить обьем output, а потом и input токенов - более компактная структура, выкидывание ненужного
3) У gemini есть настройка приоритета; но вызов тогда стоит в ~2 раза дороже
4) Анализ использования кэша —> фикс промптов и последовательности подачи контекста
P.S. Классические вещи типа параллелизации запросов я не покрываю тут; здесь скорее llm specific вещи
Кратко (AI)
Автор делится практическими методами оптимизации скорости выполнения задач с использованием LLM. Основные рекомендации включают переход на более компактные модели, сокращение объема входных и выходных токенов, использование настроек приоритета в Gemini и оптимизацию кэширования контекста.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖