← к умной ленте

Tencent представила Hunyuan3D-Buffalo 1.0 — 3D-модель с «пониманием» структуры объектов

Tencent показала Hunyuan3D-Buffalo 1.0 — экспериментальное развитие своей линейки Hunyuan3D. В отличие от обычной генерации 3D по картинке или тексту, Buffalo умеет понимать структуру объекта: отвечать на вопросы о нём, находить отдельные детали по текстовому описанию, удалять или заменять их, а также генерировать геометрию прямо из текста — всё в одном пайплайне, без отдельных моделей под каждую задачу.

Главный акцент разработки не на красоте image-to-3Di генерации, а на осмысленном редактировании и работе с частями модели — то есть система сначала «понимает», где у объекта крылья, колёса или другие детали, а затем может что-то с ними сделать по команде.

1.0версия релиза Hunyuan3D-Buffalo
2.1версия базового генератора Hunyuan3D
  • В основе системы лежит генератор Hunyuan3D-2.1, к которому добавили 3D-VLMi (визуально-языковую модель), работающую как «мозг» системы
  • По данным Нейронавт, архитектура строится на общем бэкбоне Hunyuan3D-VLM, связывающем язык и 3D-представление, поверх которого работают DiT-модулиi для генерации, редактирования и построения частей объекта
  • Модель может выделять отдельные семантические части объекта по словесному запросу и редактировать готовый меш по инструкции без пересоздания объекта целиком
  • Пока Buffalo существует как ресерч-прототип: публичных весов, кода и рабочего Hugging Face Demo нет, требования к железу неизвестны
  • Большинство представленных результатов показано самими разработчиками
  • Ссылка на проект: tencent-hunyuan.github.io/Hunyuan3D-Buffalo1.0/
Что дальше

Опенсорс (публичные веса, код и демо) ожидается, но пока не выпущен — сроки релиза источники не называют.

Здесь появится ссылка, когда это произойдёт.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖