← к ленте

RE-GoT: эволюция вознаграждений через графы мыслей

T@kryak_startupAI-инженер
2 нед

Обзор фреймворка RE-GoT, использующего графы мыслей и визуальную валидацию для автоматической оптимизации функций вознаграждения в RL.

Автоматизация создания правил обучения для ИИ снижает зависимость от ручного труда разработчиков.

  • RE-GoT позволяет моделям самостоятельно оценивать и уточнять свои цели.
  • Использование Rust для управления памятью позволяет масштабировать сложные деревья решений до 84к+ узлов.
  • Метод снижает риск ошибок при проектировании функций вознаграждения в сложных задачах.
The RE-GoT (Reward Evolution with Graph-of-Thoughts) - или опять все переписывать / эволюционировать. +1 уровень абстракции... - next step, пока в других чатах крутятся задачи... Начал моделировать дальше и проверять прогнозирование / моделирование наперед и получил "Rust MCTS(Monte Carlo Tree Search) Nodes (84,203)" -> уровень фрактальной рекурсии 5, когда проходят разные гипотезы от изначальной задачи с помощью ее декомпозиции и деревьер решений/возможности. Внезапна продумать на 5 шагов "вниз"/"вглубь" - это уже 84k+ узлов которые надо обрабатывать. /***/ Количество узлов-гипотез в памяти. Это число симулированных вариантов развития событий. Благодаря хранению в Rust (Lock-Free Arena Allocator), Питону не нужно держать 84к объектов в RAM, что предотвращает утечки памяти (Memory Leaks) и зависание Garbage Collector'а. /***/ Описание про Re-GOT: *** The RE-GoT (Reward Evolution with Graph-of-Thoughts) framework is an advanced bi-level artificial intelligence architecture designed to optimize reinforcement learning (RL) tasks by combining graph-based reasoning with visual validation. Instead of relying on manual, human-crafted reward functions, RE-GoT lets large language models (LLMs) and visual language models (VLMs) autonomously build, evaluate, and refine task rewards. *** Красивая картинка в комментах откуда взял: paper'ы 2509.16136v2 + 2509.16136 из arxiv org
RE-GoT: эволюция вознаграждений через графы мыслей

Кратко (AI)

Автор анализирует фреймворк RE-GoT (Reward Evolution with Graph-of-Thoughts), который позволяет LLM и VLM самостоятельно формировать функции вознаграждения для обучения с подкреплением. Для эффективной обработки графа решений (MCTS) используется Rust с Lock-Free Arena Allocator, что позволяет избежать проблем с памятью в Python при работе с десятками тысяч узлов.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖