ИИ-агенты понимают, получится ли у них код, ещё до того, как его напишут
Вышла интересная работа: исследователи заглянули во внутренние состояния coding-агентов и попробовали понять, что модель уже «знает» про код, над которым работает.
Масштаб нормальный:
– две открытые модели: Qwen3.6-35B-A3B и Laguna-XS.2
– 1231 задача из SWE-Bench Verified и Pro
– 22 714 запусков агента
– почти 80 тысяч изменений кода
– медианная попытка – 52 шага и 36 тысяч токенов
К внутренним состояниям модели подключили простую логистическую регрессию, то есть простой классификатор. И он смог определять:
– полностью ли работает код – AUC до 0,83
– стало ли упавших тестов меньше – до 0,84
– компилируется ли код – до 0,78
– не сломал ли агент уже работавшие тесты
Здесь 0,5 – случайное угадывание, так что сигнал довольно сильный. Причём лучше всего он читался не из последнего слоя модели, а примерно из середины.
Но самое интересное – можно было частично предсказывать не только текущее состояние кода, но и будущее!
По тому, что происходило внутри модели сейчас, исследователи угадывали, будет ли код рабочим примерно через 25 шагов. К этому моменту AUC падал до ~0,55 на SWE-Bench Verified и ~0,65 на более сложном SWE-Bench Pro, но всё ещё оставался выше случайности. Слабый сигнал сохранялся даже через 50 шагов – около 0,52 и 0,60 соответственно. Авторы назвали это latent programming horizon.
Важная оговорка: шаг – это не обязательно новая правка. Агент может читать файлы, искать по проекту и запускать тесты. В медианной траектории было всего два реальных изменения кода. Поэтому речь не о том, что модель заранее держит в голове готовый патч.
Скорее, она довольно рано понимает общее направление: задача реально чинится или агент уже куда-то не туда поехал.
Практический смысл хороший: можно раньше останавливать провальные попытки, запускать параллельную ветку, повышать effort или подключать более сильную модель – до того, как агент сожжёт десятки тысяч токенов.
Короче, код ещё не написан, а модель уже немного понимает, получится он или нет. Следующий шаг – научиться не просто читать этот сигнал, а использовать его, чтобы рулить агентом. Вот это будет прикольно.
https://arxiv.org/abs/2607.05188v1