← к ленте

Почему попытки «очеловечить» или сжать ответы LLM вредят качеству

Б@blognotAI-инженер
2 нед

Разбор рисков при модификации промптов для сжатия или стилизации ответов LLM и советы по реальной оптимизации контекста в Claude Code.

Попытки сэкономить токены через изменение стиля ответов часто приводят к потере качества работы ИИ.

  • Принудительное сжатие или упрощение ответов заставляет модель отбрасывать важные детали.
  • Для отладки работы агента полезнее использовать подробный (Explanatory) стиль, а не краткий.
  • Реальный расход контекста связан с кэшированием, а не с длиной ответов модели.
Хороший разбор вреда от попыток сэкономить токены или как-то еще модифицировать ответы агентов, типа "Говори со мной как пещерный человек" или "говори со мной на упрощенном техническом английском". Переформулируя и сжимая ответ, агент неизбежно что-то выбрасывает из вывода и это может быть важная информация. У меня, кстати, наоборот, включен Explanatory стиль в Claude Code и я регулярно по таким фразам отлавливаю дрейф агента от цели. Излишнего расхода контекста от этого не возникает. Если хочется экономить, включите себе в статусной строке Claude Code отображение записи в кэш и чтения оттуда — как только поймаете момент, когда модель пишет в кэш 400к токенов после простоя, сразу поймете, от чего реально тратится контекст, а что является только гиковской гомеопатией. https://kuber.studio/blog/Reflections/Humanising-LLM-Outputs-is-Actually-Dumb

Кратко (AI)

Автор критикует практику принудительного сжатия ответов LLM или изменения их стиля, утверждая, что это ведет к потере важной информации. Вместо этого предлагается использовать режим Explanatory для отслеживания логики агента и следить за кэшированием контекста в Claude Code для реальной экономии ресурсов.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖