Ошибка сотворения ИИ
Создав ИИ не по своему образу и подобию, мы вложили в него нечеловеческий разум и дали ему нечеловеческие глаза
Несколько лет я объяснял странную слепоту ИИ инаковостью его разума.
ИИ способен описать картину, стилизовать фото под Ван Гога, нарисовать фантастический город – и тут же ошибиться в количестве одинаковых фигур, перепутать правое и левое, не заметить геометрическую нелепость, очевидную ребенку.
Я считал: дело в том, что машина думает иначе.
Теперь же вижу - это не весь ответ.
Еще до того, как отправить изображение в «мозг» ИИ, мы задали, как он увидит мир. И задали весьма странно.
Современное компьютерное зрение показывает машине реальность идеально равномерной сеткой. Лицо ребенка, пустая стена и край дивана получают примерно одинаковое разрешение и одинаковый объем вычислений.
Мы дали ИИ электронную миллиметровку, а теперь удивляемся странному миру, что он на ней видит.
Представленная на
ICML 2026 работа Блауха, Альварес и Конкле описывает новый
фовеированный зрительный интерфейс (FOVI), организованный по принципу фовеации, т.е. с высокой центральной и пониженной периферической детализацией.
На входе ИИ как бы возникает искусственная «сетчатка»: высокая детализация в центре взгляда и все более грубое представление к периферии.
Идею фовеированного машинного зрения исследуют давно. А новизна FOVI в том, что авторы и не пытались втиснуть «сетчатку» в привычную машине прямоугольную сетку, а создали для нее V1-подобную вычислительную геометрию (V1-первичная зрительная кора).
Цена вопроса такова
• Обычная модель смотрит на все с одинаковым вниманием. В трансформере это стоит 4й степени: удвойте сторону кадра – и расходы на внимание вырастут в 16 раз.
• Человек столько не платит. Резко мы видим крохотную область в центре взгляда –
фовеа. Мозг перемещает этот островок резкости и сшивает последовательность фиксаций с памятью, ожиданиями и контекстом в переживание цельного мира.
• Если бы все поле зрения имело разрешение фовеа, длинная ось зрительной коры выросла бы в 25 раз – до 1,2 метра. То, что кажется несовершенством наших глаз, оказывается
древнейшей технологией сжатия реальности.
• Фовеированный вариант модели сохранил 97% точности за 1/3 вычислений и 1/16 пикселей.
И тут начинается самое интересное
FOVI не доказала, что ИИ научился видеть пространство по-человечески. Авторы вообще не проверяли те провалы, о которых писалось в начале поста: счет объектов, право и лево, геометрические нелепости. Более того, авторы пишут, что выигрыш может объясняться прежде всего тем, что фовеированная модель меньше цепляется за нерелевантный фон.
Т.е. пересадка подобия сетчатки пока не дала ИИ ни интуитивной физики, ни любопытства, решающего, куда дальше посмотреть.
И все же эта работа меняет многое
Раньше я считал границу инаковости машинного «разума» очевидной.
Теперь эту границу приходится проводить заново и эмпирически: менять сам способ, которым мир предъявляется машине, и смотреть, какая часть инаковости исчезает вместе с изменением ее «глаз».
Мы ведь до сих пор не знаем, сколько из принятого нами за свойства иного интеллекта принадлежит самому интеллекту.
Возможно, часть «инопланетности» ИИ мы сконструировали сами, а потом решили, что это его собственное свойство.
«Я приписал разуму то, что было в глазах» – так называется мое новое эссе [
1,
2,
3,
4]
В нем – о том, почему десятилетиями человеческую фовеацию пытались втиснуть в машинную миллиметровку и получали геометрически искаженную периферию; зачем такая «сетчатка» понадобилась NVIDIA и роботам; почему экономия вычислений еще не означает появления пространственного понимания; и почему без агента, самостоятельно выбирающего следующую точку взгляда, зрительного исследования мира у ИИ не будет.
А главный вопрос эссе:
что в чужеродности машинного зрения – от природы машины, а что – от нашего инженерного произвола?
#LLMvsHomo #ИнойИнтеллект