← к ленте

Tencent представила семейство мультимодальных эмбеддинг-моделей WeMM-Embedding

вчера

Tencent открыла доступ к WeMM-Embedding — семейству мультимодальных моделей для работы с текстом, изображениями и видео, основанных на архитектуре Qwen3.5.

Новый инструмент от Tencent упрощает поиск и рекомендации для мультимедийного контента.

  • Универсальные векторы позволяют искать по тексту, фото и видео одновременно.
  • Технология сжатия векторов экономит ресурсы при сохранении высокой точности.
  • Модели уже доказали эффективность в реальных задачах рекомендаций WeChat.
🌟 Tencent открыла набор мультимодальных эмбеддингов Команда WeChat китайского техгиганта выложила в открытый доступ семейство эмбеддинг-моделей WeMM-Embedding, предназначенных для создания универсальных векторных представлений. Набор работает с текстом, изображениями, видеороликами, сложными визуальными документами и смешанным контентом, объединяя их в единое семантическое пространство. Эмбеддинги учили с использованием Matryoshka Representation Learning, который позволяет на этапе применения обрезать размерность вектора, экономя память и вычисления. Построено семейство на Qwen3.5, на выходе младшая модель дает нормализованный вектор на 2048 измерений, а старшая - на 4096.
Tencent приводят цифру, что при сжатии до 256 измерений двухмиллиардная модель сохраняет 98,7% исходного качества на задачах с фото и видео.
Опубликованы веса трех размерностей: 2B4B и 9B 🟡 Тесты 9B берет новый лучший общий результат на MMEB-v2 (80,6 балла), а 2B обходит Qwen3-VL-Embedding, который вчетверо больше нее. Но есть аргумент посильнее бенчей - семейство работает в рекомендациях и поиске WeChat. Она развернута для обработки каналов, аккаунтов и электронной коммерции.
Команда мессенджера говорит, что WeMM-Embedding показали стабильные улучшения в 14 онлайновых A/B-тестах.
Модели работают с библиотекой Transformers и поддерживаются vLLM и SGLang.
Единственным ограничением текущей версии является отсутствие поддержки аудио
📌Лицензирование: Apache 2.0 License 🟡Arxiv 🟡Веса 🖥Githib @ai_machinelearning_big_data #AI #ML #Embeddings #WeChat #Tencent
Tencent представила семейство мультимодальных эмбеддинг-моделей WeMM-Embedding

Кратко (AI)

Tencent выпустила семейство мультимодальных эмбеддинг-моделей WeMM-Embedding, способных обрабатывать текст, изображения и видео в едином семантическом пространстве. Модели основаны на архитектуре Qwen3.5 и используют метод Matryoshka Representation Learning для оптимизации размерности векторов. Решение уже внедрено в сервисы WeChat и доступно под лицензией Apache 2.0.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖