← к ленте

FOVI: новый подход к машинному зрению через фовеацию

М@theworldisnoteasyAI-инженер
1 нед

Анализ новой работы FOVI, предлагающей имитировать человеческую сетчатку в ИИ для оптимизации вычислений и изменения восприятия пространства машиной.

Изменение способа «зрения» ИИ может сделать его более эффективным и понятным для человека.

  • Фовеация позволяет ИИ экономить до 2/3 вычислительных ресурсов при сохранении высокой точности.
  • Переход от равномерной сетки к биологически подобной геометрии может устранить некоторые ошибки восприятия пространства.
  • Исследование ставит под сомнение, являются ли текущие странности ИИ фундаментальными или лишь результатом инженерных ограничений.
Ошибка сотворения ИИ Создав ИИ не по своему образу и подобию, мы вложили в него нечеловеческий разум и дали ему нечеловеческие глаза Несколько лет я объяснял странную слепоту ИИ инаковостью его разума. ИИ способен описать картину, стилизовать фото под Ван Гога, нарисовать фантастический город – и тут же ошибиться в количестве одинаковых фигур, перепутать правое и левое, не заметить геометрическую нелепость, очевидную ребенку. Я считал: дело в том, что машина думает иначе. Теперь же вижу - это не весь ответ.
Еще до того, как отправить изображение в «мозг» ИИ, мы задали, как он увидит мир. И задали весьма странно.
Современное компьютерное зрение показывает машине реальность идеально равномерной сеткой. Лицо ребенка, пустая стена и край дивана получают примерно одинаковое разрешение и одинаковый объем вычислений.
Мы дали ИИ электронную миллиметровку, а теперь удивляемся странному миру, что он на ней видит.
  Представленная на ICML 2026 работа Блауха, Альварес и Конкле описывает новый фовеированный зрительный интерфейс (FOVI), организованный по принципу фовеации, т.е. с высокой центральной и пониженной периферической детализацией. На входе ИИ как бы возникает искусственная «сетчатка»: высокая детализация в центре взгляда и все более грубое представление к периферии.   Идею фовеированного машинного зрения исследуют давно. А новизна FOVI в том, что авторы и не пытались втиснуть «сетчатку» в привычную машине прямоугольную сетку, а создали для нее V1-подобную вычислительную геометрию (V1-первичная зрительная кора).   Цена вопроса такова • Обычная модель смотрит на все с одинаковым вниманием. В трансформере это стоит 4й степени: удвойте сторону кадра – и расходы на внимание вырастут в 16 раз. • Человек столько не платит. Резко мы видим крохотную область в центре взгляда – фовеа. Мозг перемещает этот островок резкости и сшивает последовательность фиксаций с памятью, ожиданиями и контекстом в переживание цельного мира. • Если бы все поле зрения имело разрешение фовеа, длинная ось зрительной коры выросла бы в 25 раз – до 1,2 метра. То, что кажется несовершенством наших глаз, оказывается древнейшей технологией сжатия реальности. • Фовеированный вариант модели сохранил 97% точности за 1/3 вычислений и 1/16 пикселей.   И тут начинается самое интересное FOVI не доказала, что ИИ научился видеть пространство по-человечески. Авторы вообще не проверяли те провалы, о которых писалось в начале поста: счет объектов, право и лево, геометрические нелепости. Более того, авторы пишут, что выигрыш может объясняться прежде всего тем, что фовеированная модель меньше цепляется за нерелевантный фон. Т.е. пересадка подобия сетчатки пока не дала ИИ ни интуитивной физики, ни любопытства, решающего, куда дальше посмотреть.   И все же эта работа меняет многое Раньше я считал границу инаковости машинного «разума» очевидной. Теперь эту границу приходится проводить заново и эмпирически: менять сам способ, которым мир предъявляется машине, и смотреть, какая часть инаковости исчезает вместе с изменением ее «глаз». Мы ведь до сих пор не знаем, сколько из принятого нами за свойства иного интеллекта принадлежит самому интеллекту.
Возможно, часть «инопланетности» ИИ мы сконструировали сами, а потом решили, что это его собственное свойство.
  «Я приписал разуму то, что было в глазах» – так называется мое новое эссе [1, 2, 3, 4]   В нем – о том, почему десятилетиями человеческую фовеацию пытались втиснуть в машинную миллиметровку и получали геометрически искаженную периферию; зачем такая «сетчатка» понадобилась NVIDIA и роботам; почему экономия вычислений еще не означает появления пространственного понимания; и почему без агента, самостоятельно выбирающего следующую точку взгляда, зрительного исследования мира у ИИ не будет.   А главный вопрос эссе: что в чужеродности машинного зрения – от природы машины, а что – от нашего инженерного произвола?   #LLMvsHomo #ИнойИнтеллект
FOVI: новый подход к машинному зрению через фовеацию

Кратко (AI)

Автор анализирует новую архитектуру машинного зрения FOVI, представленную на ICML 2026, которая имитирует человеческую фовеацию для повышения эффективности обработки изображений. В отличие от стандартных моделей, обрабатывающих всё поле зрения с одинаковым разрешением, FOVI использует V1-подобную геометрию, что позволяет значительно снизить вычислительные затраты. Автор ставит вопрос: является ли «инопланетность» машинного разума его врожденным свойством или следствием ограничений, наложенных инженерами при проектировании способов восприятия мира.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖