← к ленте

Анализ эффективности поиска информации агентами и людьми на ICLR 2026

Д@stuffyNLPAI-инженер
1 мес

Обзор исследований с ICLR 2026 о том, как агенты и люди ищут ответы в документах, а также новые подходы к обучению моделей с подкреплением.

Как агенты и люди работают с документами, в которых нужно найти ответ на вопрос? Выясняют на ICLR 2026 Продолжаем делиться работами с конференции. А о том, что мы сами привезли на ICML, читайте в канале ML Underhood. Strategic Navigation or Stochastic Search? How Agents and Humans Reason Over Document Collections Авторы задали людям и агентам 2250 вопросов, ответы на которые спрятаны внутри 800 разных PDF и документов. В ходе нового теста MADQA записывали не только финальный ответ, но и весь путь поиска. В результате: • Лучшие агенты уже догнали людей по точности (около 82%), но берут грубой силой, а не умом. • Человек находит ответ с первой попытки в 50% случаев, лучший агент (Gemini 3 Pro) — только в 12%. • Агенты не умеют останавливаться: если задача не по зубам, крутятся по кругу и жгут ресурсы. • Увеличение объёма вычислений не спасает. Один агент потратил 270 млн токенов и 850 долларов, но проиграл более дешёвому и аккуратному. • Около 20% вопросов не осилил никто: ни люди, ни агенты. Новизна работы в том, что в обычных тестах оценивают только корректность ответа. Здесь впервые измеряли, насколько эффективно система к нему пришла, считая каждый шаг поиска. RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments В этой работе предлагают обучаться на верифицируемых средах, сложность которых растёт динамически. Авторы собрали RLVE-Gym из 400 verifiable-задачек. Когда модель начинает хорошо справляться с текущими задачами, уровень их сложности растёт. Получается своего рода curriculum, который не только ускоряет сходимость, но и бустит общее качество. Position: RL Researchers Need to Distinguish Between Solving Simulators and Using Simulators as a Proxy Ресёрчеры из Университета Альберты неожиданно выдают базу в position-статье: оказывается, что если геймить среду, то агент будет плохо работать в онлайне 🤷‍♂️ Нашёл для вас эти статьи Андрей Соколов #YaICML2026 Душный NLP

Кратко (AI)

В обзоре представлены ключевые исследования с конференции ICLR 2026, посвященные эффективности работы ИИ-агентов с документами. Исследование MADQA показало, что агенты достигают человеческой точности, но проигрывают в эффективности поиска и склонны к избыточному потреблению ресурсов. Также рассматриваются методы динамического обучения с подкреплением и критика использования симуляторов в качестве прокси-сред для обучения моделей.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖