UEmbed
мультимодальная модель эмбеддингов от Alibaba
2B, 4B, 9B
UEmbed это
decoder‑only модель, которая в одном проходе генерирует сразу два типа представлений:
-
плотные (dense) для семантического поиска и задач типа retrieval
-
разреженные (sparse, лексические) хорошо работает для классического лексического поиска
При этом модель принимает на вход
текст, изображения и видео и выдаёт для них совместимые эмбеддинги, то есть можно искать текст по картинке, картинку по видеофрагменту и т. п.
Единое векторное пространство: разные модальности приводятся к общему представлению, что удобно для гибридного поиска.
Гитхаб
HF
#multimodal