Метод отжига от зацикливания вашего агент 😗
Сижу я тут в одном чатике. И вижу сабж от @asboltenko:
К слову хотел поделиться лайфхак, на случай если пропустили, если и когда агенты начинают тупить и топтаться на месте в решении какой-то задачи, им нужно сказать "проведи исследование", "поищи информацию", тогда у них включается режим исследования и они выходят за рамки своих знаний и начинают искать и изучать информацию и результат резко улучшается.
И тут я думаю, так это же похоже на
метод отжига в мат.оптимизации. Если только немножко его доделать под LLM и агентов. 🧠
Ну действительно, представьте, вы уже знакомы с
self refining и
OPRO/
GEPA методами самоулучшения рассуждений и промптов. В них мысль проста, ваша среда - политика это и есть модель, она порождает на контекст генерации, значит её можно bbox оптимизировать направленно при помощи управления промптами и/ или параметрами генерации. Таким образом, мы живём в пространстве возможных генераций от входа.
Теперь идём дальше, вот цитата выше -
агент застрял в решении,те сошёлся в локальном минимуме возможных исходов генераций.
Как его оттуда сдвинуть?
1.
Смена температуры.
Когда вы говорите "проведи исследование", вы переключаете агента из режима greedy decoding в режим исследования - аналог поиска в глубину против поиска в ширину.
Чтобы усилить эффект, можно явно попросить: "Сгенерируй 3 самых диких/неочевидных гипотезы, даже если они ошибочные" - это тот самый "шаг назад в менее выгодное решение", который выбивает из локальной колеи рассуждений.
Кстати, мы люди, также делаем порой. Говорим себе стоп, давай начнём сначала или сделаем шаг назад.
2.
Декомпозиция шага назад. Метод отжига требует времени на "остывание". Поэтому после команды" "исследовать" обязательно нужно дать лимит:" ..выдели на это 5 итераций размышлений, а затем вернись к исходной задаче и предложи финальный план". Иначе агент может улететь в бесконечный поиск и перерасход токенов.
3.
Критическая разница с мат. оптимизацией. В математике отжиг принимает плохое решение на основе функции вероятности. В LLM мы не можем доверить случайность - вместо этого просим сменить перспективу. Это и дает тот же эффект перепрыгивания ямы, но детерминированно и осмысленно.
Лайфхак вдогонку. Если агент топчется, скажите не просто исследуй, а "составь карту неопределённости" – перечисли, чего именно тебе не хватает для решения. Это принудительно расширяет границы знаний перед тем, как начать гуглить, и резко сокращает галлюцинации во время этого отжига.
Однако правило, как понять, что агент застрял всеравно придётся написать. 👍
И да, что
метод из цитаты. Что улучшение отжига
требует больше токенов, но может спасти вас от траты того же числа токенов не тупик и зацикливания. 🧠