Alibaba представила мультимодальную модель эмбеддингов UEmbed
Н@GreenNeuralRobotsAI-инженер
3 недAlibaba выпустила UEmbed — мультимодальную decoder-only модель для генерации плотных и разреженных эмбеддингов текста, изображений и видео.
Новый инструмент для создания универсальных поисковых систем, работающих одновременно с текстом, фото и видео.
- Позволяет искать контент разных типов (например, текст по картинке) в рамках одной модели.
- Поддерживает генерацию как семантических, так и лексических представлений данных.
- Упрощает архитектуру систем гибридного поиска за счет единого векторного пространства.
UEmbed
мультимодальная модель эмбеддингов от Alibaba
2B, 4B, 9B
UEmbed это decoder‑only модель, которая в одном проходе генерирует сразу два типа представлений:
- плотные (dense) для семантического поиска и задач типа retrieval
- разреженные (sparse, лексические) хорошо работает для классического лексического поиска
При этом модель принимает на вход текст, изображения и видео и выдаёт для них совместимые эмбеддинги, то есть можно искать текст по картинке, картинку по видеофрагменту и т. п.
Единое векторное пространство: разные модальности приводятся к общему представлению, что удобно для гибридного поиска.
Гитхаб
HF
#multimodal

Кратко (AI)
Компания Alibaba представила UEmbed, семейство мультимодальных моделей с архитектурой decoder-only. Модели способны генерировать как плотные, так и разреженные эмбеддинги для текста, изображений и видео в едином векторном пространстве, что упрощает задачи гибридного поиска.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖