Большие языковые модели хорошо распознают изображения.
Могут подробно описать, что они там видят и даже где оно примерно находится на листе.
Но с точным позиционированием элементов на картинке всё ещё справляются не идеально. Для этого существует отдельный класс моделей.
Нашёл на Hugging Face маленькую узкоспециализированную модель для разметки скриншотов веб-страниц. Называется
ScreenParser.
По факту, это YOLO, дообученный на
вот этом датасете из 1,45 миллионов веб-страниц.
Модель крошечная (25 миллионов параметров), поэтому без проблем запустится на вашем рабочем ноутбуке.
Размечает на bbox-ы и класс элемента. Всего есть 55 классов, которые могут существовать на веб-странице. В JSON складывает также уверенность в том, что элемент распознан верно. Если уверенность низкая, то всегда можно сделать кроп нужной области и отправить на распознание ещё раз.
Я уже попробовал модель в качестве одного из инструментов при вёрстке макетов по картинке. Пример разметки можете увидеть в медиа поста.
Ставьте 🔥 , если хотите скилл по вёрстке из картинки/скриншота с помощью
ScreenParser.
Думаю, её также можно добавить к какой-нибудь мелкой on-prem-модели для того, чтобы улучшить навык browser-use.