xAI · Grok · Grok Imagine Image 2.0 · Генерация изображений · ИИ в дизайне · Редактирование изображений · API · Vercel AI Gateway11 августа в 11:01 · 4 мин

Grok Imagine Image 2.0: Стратегия xAI переключается с генерации на точечное редактирование изображений

Компания xAI представила значительное обновление своего генератора изображений Grok Imagine Image 2.0. В отличие от конкурентов, фокусирующихся исключительно на создании новых картинок с нуля по текстовому запросу, новая модель делает ставку на инструменты для итеративной работы: точечное редактирование, удаление фона, работу с множественными референсами и интеллектуальное изменение пропорций. Релиз направлен на интеграцию модели в профессиональные пайплайны создания контента, где важна не только начальная генерация, но и последующая полировка результата.

# Grok Imagine Image 2.0: Переход от генерации к редактированию

Компания xAI выпустила очередное обновление своего визуального инструмента — Grok Imagine Image 2.0. Если предыдущие версии конкурировали в основном на поле простой генерации изображений по текстовому описанию (prompt), то новая модель четко ориентируется на сценарий сложной итеративной работы. Основная идея: первая генерация часто бывает лишь отправной точкой, а реальная работа творца заключается в точечных правках, изменении фона или подгонке композиции, а не в полном перегенерировании кадра.

Архитектура изменений: инструменты дизайнера

Разработчики заявляют, что модель обучалась не просто рисовать, а «планировать типографику и верстку как дизайнер». Это выражается в наборе специализированных функций, направленных на решение задач продакшена.

1. Точечное редактирование и сегментация Ключевой новостью стала возможность изменения только выбранных областей изображения (region edit) без затрагивания остального фона. Ранее модели часто ошибались, пытаясь дорисовать или исказить неизмененные части картинки при попытке изменить детали. Новый инструмент использует сегментацию (segmentation), позволяя пользователю выделять конкретные зоны. Также реализована функция удаления фона (background removal), которая экспортирует объект с прозрачностью в формате PNG, что критически важно для интеграции изображений в другие графические пайплайны.

Технический нюанс: Сегментация в этом контексте означает автоматическое выделение объектов на изображении на основе их формы и цвета, что позволяет модели понимать границы элементов без необходимости ручного «рисования» масок пользователем.

2. Множественные референсы (Multi-reference editing) Одной из заметных особенностей стало увеличение лимита на количество референсных изображений с трех до пяти в одном запросе. Пользователь может одновременно загрузить изображения продукта, модели, фона, логотипа или эталона стиля. Это позволяет создавать сложные композиции, где все элементы должны соответствовать определенному виду, минуя необходимость склеивать результаты разных генераций в Photoshop.

3. Умное изменение размера (Smart Resize) Модель поддерживает九个 стандартных соотношений сторон (от 1:2 до 16:9 и 2:1), адаптируя композицию, а не просто обрезая изображение. Например, если исходный кадр 1:1 и его нужно превратить в вертикальный пост 9:16, модель додумает недостающие детали, сохраняя целостность стиля.

Практическая применимость и шаблоны

xAI предусмотрела готовые рабочие процессы (workflows) в виде 15 шаблонов. Вместо того чтобы писать сложный промпт с нуля, пользователь выбирает категорию: «Профессиональный портрет», «Обложка товара для e-commerce», «Иконки для UI» или «Эмодзи». Система подставляет нужные настройки под тип задачи, что ускоряет рутинные операции.

Особое внимание уделено консистентности (единообразию) образов. Модель позволяет генерировать персонажей, локации и предметы отдельно, но в едином визуальном стиле. xAI презентует это как подготовку к производству видео, особенно учитывая, что параллельно развивается видео-модель Imagine Video.

Сравнительный анализ и бенчмарки

Эффективность модели была оценена в независимых тестах на платформе Arena.ai. Результаты показали высокую конкурентоспособность:

* Arena for Image Editing (Изменение изображений): xAI занимает 2-е место с рейтингом Elo 1439, уступая только GPT-Image-2 (1463). * Arena for Text-to-Image (Генерация по тексту): xAI занимает 2-е место с рейтингом Elo 1320, уступая GPT-Image-2 (1380).

Стоит отметить разницу в скорости обработки. По тестам, Grok Imagine Image 2.0 генерирует изображения значительно медленнее аналога от Nano Banano, но показывает лучшие результаты по качеству и точности следования инструкции по сравнению с GPT Image 2 в некоторых задачах.

Доступность и стоимость

На момент публикации модель доступна через API только в режиме предпросмотра (preview) через сервис Vercel AI Gateway. Стоимость генерации составляет 0.05$ за вызов. Для сравнения, конкурентные модели стоят от 0.0675$ до 0.18$. Даже если не все продвинутые функции будут работать через API, низкая стоимость и высокое качество базовой генерации делают модель привлекательной для широкого круга пользователей.

Китайские аналоги, как отмечает автор обзора, в данный момент не дотягивают до уровня качества Nano Banano, поэтому наличие дешевой и качественной модели у многих станет основным инструментом в работе. Официальный релиз и полная интеграция в экосистему ожидается в ближайшее время, что должно открыть доступ через российские сервисы, такие как VEGA.

Первоисточники

Habr AI
← Вернуться в эфир