До вмісту

WorldClaw від Tencent створює редаговані 3D-світи з тексту: як працює новий AI-підхід

Агентна система планує рельєф і регіони, генерує окремі 3D-об'єкти та сама перевіряє сцену на колізії й помилки.

WorldClaw — дослідницький проєкт Tencent Hunyuan, який намагається перетворювати відкритий текстовий опис не на одну красиву картинку, а на великий, досліджуваний і редагований 3D-світ. Система розділяє задачу між AI-агентами: одні планують карту, інші будують рельєф і матеріали, ще інші створюють та розміщують об'єкти, а фінальний агент перевіряє сцену й виправляє проблемні місця.

3 хв читання
Приклади згенерованих 3D-світів WorldClaw у різних сезонних стилях
Офіційний teaser WorldClaw демонструє згенеровані локації з різними типами рельєфу, об'єктами та стилями.Фото: Tencent Hunyuan / Hunyuan3D-WorldClaw

Від картинки до цілого світу

Генеративний ШІ вже навчився створювати окремі 3D-об'єкти, зображення й короткі відеосцени. Але побудувати великий простір, у якому рельєф, дороги, рослинність, будівлі та інші об'єкти логічно пов'язані між собою, значно складніше. Саме цю задачу намагається вирішити WorldClaw — дослідницька система команди Tencent Hunyuan.

Ідея звучить майже як інструмент із редактора майбутнього: користувач описує світ звичайним текстом, а система перетворює запит на структурований план, створює глобальний рельєф, наповнює окремі регіони об'єктами й потім кілька разів перевіряє результат. Важлива деталь — на виході маємо не лише красиву картинку, а сцену з окремими 3D-об'єктами, які можна редагувати та повторно використовувати.

Чому це складніше, ніж «намалюй мені острів»

Для великої 3D-сцени недостатньо зробити переконливий кадр. Світ має залишатися просторово узгодженим, коли камера рухається; будинки не повинні висіти над землею, дерева — проростати крізь споруди, а різні частини ландшафту — суперечити одна одній. Крім того, розробнику потрібен контроль: можливість пересунути будинок, замінити дерево, перефарбувати матеріал або перебудувати окрему ділянку без повної генерації сцени з нуля.

Автори WorldClaw тому розділяють глобальне планування і локальну деталізацію. Спочатку агенти визначають регіони, типи місцевості, матеріали, об'єкти та їхні просторові зв'язки. Потім система створює основу ландшафту, а лише після цього детально заповнює потрібні ділянки.

Як WorldClaw збирає 3D-сцену

Пайплайн починається з аналізу текстового опису. З нього формується специфікація світу: де будуть гори, рівнини, вода, поселення, дороги, рослинність і характерні об'єкти. Далі система генерує семантичну карту регіонів і height field — основу майбутнього рельєфу. Матеріали та природні асети прив'язуються до конкретних зон, щоб різні частини карти виглядали послідовно.

На наступному рівні WorldClaw працює з регіонами, яким потрібна складніша деталізація. Система створює композицію сцени, виділяє в ній окремі об'єкти, реконструює їх як 3D-меші та повертає на відповідні позиції у світі. Після цього агент знову рендерить сцену з діагностичних ракурсів і шукає проблеми з масштабом, позою, контактом із землею та колізіями.

Під капотом — кілька моделей і Blender

WorldClaw не є однією моделлю, яка робить усе. У дослідницькій конфігурації автори використовували Claude Opus 4.8 як базову агентну модель, а також GPT-Image-2, SAM3, SAM3D і Hunyuan3D для різних етапів роботи. Генерація рельєфу, розміщення об'єктів, доопрацювання сцени та рендеринг виконувалися у Blender 5.1.1.

Експерименти проводилися на сервері з чотирма NVIDIA H20. Це важливий контекст: WorldClaw поки не схожий на легкий застосунок, який завтра встановлять на звичайний ноутбук. Це дослідницький пайплайн, що показує напрямок розвитку інструментів для 3D-контенту.

Чому це особливо цікаво для ігор

Найцікавіша частина WorldClaw — не швидкість створення красивої сцени, а редагованість. Якщо підхід стане стабільнішим і швидшим, він може скоротити відстань між ідеєю та першим прототипом рівня. Геймдизайнер зможе описати тип локації, отримати чернетку світу, пройтися нею, а потім уже вручну допрацьовувати геометрію, композицію і gameplay-зони.

Те саме стосується VR/AR, симуляцій, віртуального продакшену, навчальних середовищ і цифрових двійників. У всіх цих сценаріях важливо мати не просто зображення, а простір із явною геометрією та окремими елементами, якими можна керувати.

Що WorldClaw поки не доводить

Проєкт не варто сприймати як готову заміну художникам або level-дизайнерам. У статті автори самі описують обмеження: високу залежність від якості базових моделей, ризики помилок у коді, значні обчислювальні витрати та довгий багатоетапний процес. Деякі об'єкти ще не мають повноцінної внутрішньої структури, артикуляції або інтерактивної логіки.

Також публічний GitHub WorldClaw зараз є радше сторінкою дослідницького проєкту з матеріалами та посиланням на paper, а не готовим репозиторієм, з якого можна просто встановити повний генератор і повторити демонстрації.

Куди рухається 3D-генерація

У цьому й полягає головна цінність WorldClaw: система показує, як генеративний AI переходить від створення окремого контенту до побудови структурованого середовища. Автори прямо розглядають подальшу інтеграцію з production-інструментами та game engines на кшталт Unreal Engine, де до геометрії додаються навігація, фізика, procedural generation і runtime-взаємодія.

Якщо цей напрямок розвинеться, промпт стане не фінальним результатом, а початком творчого процесу: людина описує задум, агенти збирають складну технічну основу, а автор вирішує, яким має бути сам світ. Для ігрової індустрії це значно цікавіше за черговий генератор красивих картинок.

Головне про WorldClaw

Tencent Hunyuan показала дослідницький підхід, у якому AI-агенти збирають великий 3D-світ поетапно, а не генерують його як єдину нероздільну сцену.

  • WorldClaw перетворює відкритий текстовий опис на структурований, досліджуваний і редагований 3D-світ.
  • Глобальний рельєф і локальні об'єкти генеруються окремо, щоб зберігати контроль над сценою.
  • У дослідах використовували Claude Opus 4.8, GPT-Image-2, SAM3, SAM3D, Hunyuan3D і Blender 5.1.1.
  • Це поки дослідницький пайплайн, а не готовий масовий 3D-редактор для встановлення одним кліком.

WorldClaw у цифрах

3
великі етапи

Аналіз і планування → глобальний рельєф → регіональні об'єкти та refinement.

4 × H20
GPU у дослідах

Автори проводили експерименти на сервері з чотирма NVIDIA H20.

4
репрезентативні світи

У paper детально показані піратський острів, каньйон, пустельне поле бою та засніжена футуристична долина.

Пайплайн

Як текст перетворюється на 3D-світ

  1. 1. Планування

    Агент читає опис і формує структуру регіонів, рельєфу, матеріалів, об'єктів і просторових зв'язків.

  2. 2. Глобальний рельєф

    Система створює семантичну карту, height field, матеріали та природні асети, зберігаючи узгодженість великих зон.

  3. 3. Об'єкти та перевірка

    Локальні об'єкти реконструюються як окремі 3D-меші, розміщуються на місцевості, після чого агент рендерить сцену й виправляє масштаб, колізії та контакт із землею.

Офіційна схема WorldClaw: планування, генерація глобального рельєфу, регіональні об'єкти та refinement. Джерело: Tencent Hunyuan.Джерело ↗
Перевірка фактів

Джерела та перевірка

  1. arXiv / Tencent HunyuanWorldClaw: Agentic 3D Open-World Generation at Scale
    Первинне джерелоПеревірено 2026-08-20Відкрити джерело ↗
  2. Tencent HunyuanHunyuan3D-WorldClaw — official project repository
    Первинне джерелоПеревірено 2026-08-20Відкрити джерело ↗
  3. t3nMit nur einer Zeile: Dieses KI-Tool erschafft per Prompt komplette 3D-Welten
    Вторинне джерелоПеревірено 2026-08-20Відкрити джерело ↗
Далі на RankPoint

Читайте більше

Коментарі0 коментарів

Коментарі

Поки що коментарів немає.Обговорення ведеться окремо для кожної мовної версії матеріалу.