ChatGPT и Blender: эксперимент по генерации 3D-ассетов
Исследование показывает, что использование крупных языковых моделей (LLM) для написания скриптов автоматического моделирования в Blender способно создавать рабочие черновые заготовки. Однако для сложных объектов, требующих высокой детализации или анатомической точности, этот подход пока не обеспечивает коммерчески viable результата без последующей ручной правки.
# Делаем 3D-ассеты: ChatGPT + Blender
В современной разработке игр и визуального контента исследуются новые способы ускорения рабочего процесса. Эксперимент, проведенный командой StudyAI, направлен на проверку гипотезы: может ли ИИ, работающий в связке с генеративным моделированием, создавать полноценные 3D-модели, используя только текстовые описания.
Целью эксперимента было не создание шедевров, а проверка жизнеспособности воркфлоу (workflow), где большая языковая модель (LLM) выступает в роли архитектора кода для сценария генерации сцен, а Blender выполняет операции моделирования.
*«Понимание границ возможного важнее иллюзии вседозволенности».* — Umine Nagi
Методология и подход
В основе эксперимента лежит концепция использования промтов (текстовых запросов) для генерации Python-скриптов. Эти скрипты затем запускаются внутри Blender, автоматически создавая геометрию объектов. Для обеспечения простоты и фокусировки на результатах LLM были выбраны объекты в стиле «лоуполи» (low-poly) — низкого полигонального моделирования, характерного для ретро-игр.
Объекты были выбраны случайно: от средневековых щитов и пушек до алхимических башенок и тронов. Промты (запросы) формировались на русском языке и содержали максимально простые описания, например: «Напиши скрипт для Блендера. Это 3D-модель деревянного, англо-саксонского щита, усеянного стрелами...»
Важно понимать роль нейросети в этом процессе. ИИ не «видит» объекты в реальном времени, он генерирует математический код (скрипт), который Blender интерпретирует и превращает в трехмерную форму. Качество итогового результата напрямую зависит от точности этого кода.
Результаты генерации: успехи и промахи
Результаты тестов демонстрируют неравномерную картину эффективности. В простых задачах ИИ показывает высокую скорость адаптации.
Простые формы Генерация круглого щита или настольной лампы (хотя и с неожиданным ориенталистским поворотом в скрипте) прошла успешно. Модель щита была создана за два минуты, рендер занял полминуты. Форма получилась грубой, но узнаваемой. Лампа, несмотря на неочевидный выбор стиля, также продемонстрировала, что базовая геометрия создается корректно.
Сложные детали и анатомия При переходе к объектам со сложной структурой или требующими понимания естественных форм, качество резко падает.
* Арбалет: Изначально скрипт создал устройство, напоминающее пистолет с тетивой. Только после уточнения запроса модель приобрела признаки классического оружия, хотя и оставалась упрощенной. * Пушка: Задача создать детализированную пушку с орнаментами, текстурой копоти и кованой головой льва завершилась полным провалом. Результатом стала надувная игрушка. Попытки улучшить результат с использованием референсных изображений в режиме высокого качества не дали ожидаемого эффекта, подтверждая сложность задачи для данной связки. * Животные: Попытка создать бронированную лошадь привела к моделям, напоминающим гибрид животных и роботов («свиборгизация»). Точная анатомия за пределами базовых форм пока остается недоступной для автоматической генерации через этот метод. * Грифоны и головы: ИИ часто игнорировал специфические требования к форме (например, «шарообразный грифон вместо головы»), хотя иногда выдавал неожиданные находки, такие как стул с ножом в качестве декора.
Низкополигональный стиль Интересно, что для объектов в стиле инди-квестов или фэнтези-декораций результат оказался приемлемым. Трон с черепами и руины получились статичными, но стилистически уместными, напоминая графику игр вроде «Finn & Jake Investigations». Это говорит о том, что ИИ лучше справляется с абстрактными формами, где не требуется строгое соответствие физическим законам.
Технические ограничения и выводы
Эксперимент выявил ключевые ограничения текущих технологий связки LLM и 3D-моделирования:
1. Граница черновика и финала: ИИ эффективно генерирует начальные референсы и грубые геометрические формы. Однако финальное качество, включающее сложную детализацию, корректную текстуру и анатомическую правдоподобность, на данный момент требует обязательной ручной доработки художником. 2. Зависимость от промтов: При неоднозначных описаниях (например, «лампа с восточным колоритом») ИИ может выбирать неверное направление. Четкие, детализированные инструкции снижают количество ошибок, но не исключают их полностью. 3. Неподходящие задачи: Для высокодетализированных (high-poly) моделей данный воркфлоу не применим. Здесь требуются более сложные алгоритмы генерации, чем те, что доступны через простой код, сгенерированный текстовой моделью.
Наиболее эффективной стратегией на текущий момент является использование нейросетей для создания исходных референсов (например, через специализированные сервисы генерации изображений), а не попытка автоматизировать сложное моделирование кодом «с нуля». Остается наблюдением, какие нейросети будут способны лучше всего справляться с промтами в будущих итерациях этого подхода.
*«Технология не заменяет мастерство, она лишь дает новые кисти для работы».* — Umine Nagi