В материале
12 разд.От картинки к целому миру
Генеративный ИИ уже научился создавать отдельные 3D-объекты, изображения и короткие видеосцены. Но построить большое пространство, где рельеф, дороги, растительность, здания и другие объекты логично связаны между собой, значительно сложнее. Именно эту задачу пытается решить WorldClaw — исследовательская система команды Tencent Hunyuan.
Идея звучит почти как инструмент из редактора будущего: пользователь описывает мир обычным текстом, а система превращает запрос в структурированный план, создаёт глобальный рельеф, наполняет отдельные регионы объектами и затем несколько раз проверяет результат. Важная деталь — на выходе получается не только красивая картинка, а сцена с отдельными 3D-объектами, которые можно редактировать и повторно использовать.
Почему это сложнее, чем «нарисуй мне остров»
Для большой 3D-сцены недостаточно сделать убедительный кадр. Мир должен оставаться пространственно согласованным при движении камеры; здания не должны висеть над землёй, деревья — прорастать сквозь постройки, а разные части ландшафта — противоречить друг другу. Кроме того, разработчику нужен контроль: возможность передвинуть дом, заменить дерево, изменить материал или перестроить отдельный участок без полной генерации сцены с нуля.
Поэтому авторы WorldClaw разделяют глобальное планирование и локальную детализацию. Сначала агенты определяют регионы, типы местности, материалы, объекты и пространственные связи между ними. Затем система создаёт основу ландшафта и только после этого детально заполняет нужные участки.
Как WorldClaw собирает 3D-сцену
Пайплайн начинается с анализа текстового описания. Из него формируется спецификация мира: где будут горы, равнины, вода, поселения, дороги, растительность и характерные объекты. Далее система генерирует семантическую карту регионов и height field — основу будущего рельефа. Материалы и природные ассеты привязываются к конкретным зонам, чтобы разные части карты выглядели последовательно.
На следующем уровне WorldClaw работает с регионами, которым нужна более сложная детализация. Система создаёт композицию сцены, выделяет в ней отдельные объекты, реконструирует их как 3D-меши и возвращает на соответствующие позиции в мире. После этого агент снова рендерит сцену с диагностических ракурсов и ищет проблемы с масштабом, позой, контактом с землёй и коллизиями.
Под капотом — несколько моделей и Blender
WorldClaw — не одна модель, которая делает всё. В исследовательской конфигурации авторы использовали Claude Opus 4.8 как базовую агентную модель, а также GPT-Image-2, SAM3, SAM3D и Hunyuan3D для разных этапов работы. Генерация рельефа, размещение объектов, доработка сцены и рендеринг выполнялись в Blender 5.1.1.
Эксперименты проводились на сервере с четырьмя NVIDIA H20. Это важный контекст: WorldClaw пока не похож на лёгкое приложение, которое завтра установят на обычный ноутбук. Это исследовательский пайплайн, показывающий направление развития инструментов для 3D-контента.
Почему это особенно интересно для игр
Самая интересная часть WorldClaw — не скорость создания красивой сцены, а редактируемость. Если подход станет стабильнее и быстрее, он может сократить расстояние между идеей и первым прототипом уровня. Геймдизайнер сможет описать тип локации, получить черновик мира, пройти по нему, а затем вручную дорабатывать геометрию, композицию и gameplay-зоны.
То же касается VR/AR, симуляций, виртуального продакшена, учебных сред и цифровых двойников. Во всех этих сценариях важно иметь не просто изображение, а пространство с явной геометрией и отдельными элементами, которыми можно управлять.
Что WorldClaw пока не доказывает
Проект не стоит воспринимать как готовую замену художникам или level-дизайнерам. В статье авторы сами описывают ограничения: высокую зависимость от качества базовых моделей, риски ошибок в коде, значительные вычислительные затраты и длинный многоэтапный процесс. Некоторые объекты пока не имеют полноценной внутренней структуры, артикуляции или интерактивной логики.
Кроме того, публичный GitHub WorldClaw сейчас скорее является страницей исследовательского проекта с материалами и ссылкой на paper, а не готовым репозиторием, из которого можно просто установить полный генератор и повторить демонстрации.
Куда движется 3D-генерация
В этом и заключается главная ценность WorldClaw: система показывает, как генеративный AI переходит от создания отдельного контента к построению структурированной среды. Авторы прямо рассматривают дальнейшую интеграцию с production-инструментами и game engines вроде Unreal Engine, где к геометрии добавляются навигация, физика, procedural generation и runtime-взаимодействие.
Если это направление разовьётся, промпт станет не финальным результатом, а началом творческого процесса: человек описывает замысел, агенты собирают сложную техническую основу, а автор решает, каким должен быть сам мир. Для игровой индустрии это гораздо интереснее очередного генератора красивых картинок.
Tencent Hunyuan показала исследовательский подход, где AI-агенты собирают большой 3D-мир поэтапно, а не генерируют его как одну неразделимую сцену.
- WorldClaw превращает открытое текстовое описание в структурированный, исследуемый и редактируемый 3D-мир.
- Глобальный рельеф и локальные объекты генерируются отдельно, чтобы сохранять контроль над сценой.
- В экспериментах использовались Claude Opus 4.8, GPT-Image-2, SAM3, SAM3D, Hunyuan3D и Blender 5.1.1.
- Это пока исследовательский пайплайн, а не готовый массовый 3D-редактор для установки одним кликом.
WorldClaw в цифрах
Анализ и планирование → глобальный рельеф → региональные объекты и refinement.
Авторы проводили эксперименты на сервере с четырьмя NVIDIA H20.
В paper подробно показаны пиратский остров, каньон, пустынное поле боя и заснеженная футуристическая долина.
Как текст превращается в 3D-мир
1. Планирование
Агент читает описание и формирует структуру регионов, рельефа, материалов, объектов и пространственных связей.
2. Глобальный рельеф
Система создаёт семантическую карту, height field, материалы и природные ассеты, сохраняя согласованность крупных зон.
3. Объекты и проверка
Локальные объекты реконструируются как отдельные 3D-меши, размещаются на местности, после чего агент рендерит сцену и исправляет масштаб, коллизии и контакт с землёй.
Источники и проверка
- arXiv / Tencent HunyuanWorldClaw: Agentic 3D Open-World Generation at Scale
- Tencent HunyuanHunyuan3D-WorldClaw — official project repository
- t3nMit nur einer Zeile: Dieses KI-Tool erschafft per Prompt komplette 3D-Welten




Комментарии0 комментариев
Комментарии