Анализ эффективности поиска информации агентами и людьми на ICLR 2026
Д@stuffyNLPAI-инженер
1 месОбзор исследований с ICLR 2026 о том, как агенты и люди ищут ответы в документах, а также новые подходы к обучению моделей с подкреплением.
Как агенты и люди работают с документами, в которых нужно найти ответ на вопрос? Выясняют на ICLR 2026
Продолжаем делиться работами с конференции. А о том, что мы сами привезли на ICML, читайте в канале ML Underhood.
Strategic Navigation or Stochastic Search? How Agents and Humans Reason Over Document Collections
Авторы задали людям и агентам 2250 вопросов, ответы на которые спрятаны внутри 800 разных PDF и документов. В ходе нового теста MADQA записывали не только финальный ответ, но и весь путь поиска.
В результате:
• Лучшие агенты уже догнали людей по точности (около 82%), но берут грубой силой, а не умом.
• Человек находит ответ с первой попытки в 50% случаев, лучший агент (Gemini 3 Pro) — только в 12%.
• Агенты не умеют останавливаться: если задача не по зубам, крутятся по кругу и жгут ресурсы.
• Увеличение объёма вычислений не спасает. Один агент потратил 270 млн токенов и 850 долларов, но проиграл более дешёвому и аккуратному.
• Около 20% вопросов не осилил никто: ни люди, ни агенты.
Новизна работы в том, что в обычных тестах оценивают только корректность ответа. Здесь впервые измеряли, насколько эффективно система к нему пришла, считая каждый шаг поиска.
RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments
В этой работе предлагают обучаться на верифицируемых средах, сложность которых растёт динамически.
Авторы собрали RLVE-Gym из 400 verifiable-задачек. Когда модель начинает хорошо справляться с текущими задачами, уровень их сложности растёт. Получается своего рода curriculum, который не только ускоряет сходимость, но и бустит общее качество.
Position: RL Researchers Need to Distinguish Between Solving Simulators and Using Simulators as a Proxy
Ресёрчеры из Университета Альберты неожиданно выдают базу в position-статье: оказывается, что если геймить среду, то агент будет плохо работать в онлайне 🤷♂️
Нашёл для вас эти статьи ❣ Андрей Соколов
#YaICML2026
Душный NLP
Кратко (AI)
В обзоре представлены ключевые исследования с конференции ICLR 2026, посвященные эффективности работы ИИ-агентов с документами. Исследование MADQA показало, что агенты достигают человеческой точности, но проигрывают в эффективности поиска и склонны к избыточному потреблению ресурсов. Также рассматриваются методы динамического обучения с подкреплением и критика использования симуляторов в качестве прокси-сред для обучения моделей.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖