← к ленте

Исследование предсказания успеха ИИ-агентов через внутренние состояния

A@ai_productAI-инженер
1 мес

Исследователи выяснили, что внутренние состояния ИИ-агентов позволяют предсказать успех написания кода еще до завершения задачи.

ИИ-агенты понимают, получится ли у них код, ещё до того, как его напишут Вышла интересная работа: исследователи заглянули во внутренние состояния coding-агентов и попробовали понять, что модель уже «знает» про код, над которым работает. Масштаб нормальный: – две открытые модели: Qwen3.6-35B-A3B и Laguna-XS.2 – 1231 задача из SWE-Bench Verified и Pro – 22 714 запусков агента – почти 80 тысяч изменений кода – медианная попытка – 52 шага и 36 тысяч токенов К внутренним состояниям модели подключили простую логистическую регрессию, то есть простой классификатор. И он смог определять: – полностью ли работает код – AUC до 0,83 – стало ли упавших тестов меньше – до 0,84 – компилируется ли код – до 0,78 – не сломал ли агент уже работавшие тесты Здесь 0,5 – случайное угадывание, так что сигнал довольно сильный. Причём лучше всего он читался не из последнего слоя модели, а примерно из середины. Но самое интересное – можно было частично предсказывать не только текущее состояние кода, но и будущее! По тому, что происходило внутри модели сейчас, исследователи угадывали, будет ли код рабочим примерно через 25 шагов. К этому моменту AUC падал до ~0,55 на SWE-Bench Verified и ~0,65 на более сложном SWE-Bench Pro, но всё ещё оставался выше случайности. Слабый сигнал сохранялся даже через 50 шагов – около 0,52 и 0,60 соответственно. Авторы назвали это latent programming horizon. Важная оговорка: шаг – это не обязательно новая правка. Агент может читать файлы, искать по проекту и запускать тесты. В медианной траектории было всего два реальных изменения кода. Поэтому речь не о том, что модель заранее держит в голове готовый патч. Скорее, она довольно рано понимает общее направление: задача реально чинится или агент уже куда-то не туда поехал. Практический смысл хороший: можно раньше останавливать провальные попытки, запускать параллельную ветку, повышать effort или подключать более сильную модель – до того, как агент сожжёт десятки тысяч токенов. Короче, код ещё не написан, а модель уже немного понимает, получится он или нет. Следующий шаг – научиться не просто читать этот сигнал, а использовать его, чтобы рулить агентом. Вот это будет прикольно. https://arxiv.org/abs/2607.05188v1

Кратко (AI)

Исследователи обнаружили, что по внутренним состояниям ИИ-агентов можно предсказать успешность написания кода еще до завершения работы. Использование логистической регрессии на промежуточных слоях моделей Qwen3.6-35B-A3B и Laguna-XS.2 позволило с высокой точностью определять работоспособность кода и даже прогнозировать результат на десятки шагов вперед. Это открытие может помочь оптимизировать работу агентов, вовремя прерывая неэффективные попытки.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖