Tencent показала Hunyuan3D-Buffalo 1.0 — экспериментальное развитие своей линейки Hunyuan3D. В отличие от обычной генерации 3D по картинке или тексту, Buffalo умеет понимать структуру объекта: отвечать на вопросы о нём, находить отдельные детали по текстовому описанию, удалять или заменять их, а также генерировать геометрию прямо из текста — всё в одном пайплайне, без отдельных моделей под каждую задачу.
Главный акцент разработки не на красоте image-to-3Di генерации, а на осмысленном редактировании и работе с частями модели — то есть система сначала «понимает», где у объекта крылья, колёса или другие детали, а затем может что-то с ними сделать по команде.
- В основе системы лежит генератор Hunyuan3D-2.1, к которому добавили 3D-VLMi (визуально-языковую модель), работающую как «мозг» системы
- По данным Нейронавт, архитектура строится на общем бэкбоне Hunyuan3D-VLM, связывающем язык и 3D-представление, поверх которого работают DiT-модулиi для генерации, редактирования и построения частей объекта
- Модель может выделять отдельные семантические части объекта по словесному запросу и редактировать готовый меш по инструкции без пересоздания объекта целиком
- Пока Buffalo существует как ресерч-прототип: публичных весов, кода и рабочего Hugging Face Demo нет, требования к железу неизвестны
- Большинство представленных результатов показано самими разработчиками
- Ссылка на проект: tencent-hunyuan.github.io/Hunyuan3D-Buffalo1.0/
Опенсорс (публичные веса, код и демо) ожидается, но пока не выпущен — сроки релиза источники не называют.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖