SpatialClaw
Фреймворк от NVIDIA для пространственного рассуждения (spatial reasoning), позволяет VLM решать сложные задачи с визуальными данными, не требуя дополнительного обучения
Вместо того чтобы дообучать модель под пространственные задачи, SpatialClaw даёт ей
инструмент в виде Python‑кода, исполняемого в постоянном (persistent) вычислительном ядре. Модель выступает как агент:
*
Пишет код для анализа сцены
*
Запускает код и видит промежуточные результаты
*
Анализирует результаты и при необходимости переписывает или дополняет код
*
Компонует модули восприятия
Такой подход резко повышает точность в задачах, где нужно не просто описать картинку, а
понять геометрию, отношения между объектами и выполнить вычисления
Гитхаб
#vlm #reasoning #optimization