GPT-5.6 · Sol · Kimi K3 · AI Design · Benchmark24 июля в 01:31 · 4 мин

GPT-5.6 и Kimi K3 переписывают правила дизайна: как две модели научились отличать стиль от штампа

Команда бенчмарка Design Arena представила свежий анализ ведущих генеративных моделей, способных создавать веб-интерфейсы. В центре внимания — флагман OpenAI GPT-5.6 Sol и китайская модель Kimi K3. Исследование показало, что к высокому качеству дизайна модели приходят по радикально разным стратегиям: одна сознательно избегает визуальных клише, другая имитирует работу агента перед генерацией, а третья, прошлый лидер GLM 5.2, вовсе не знает о существовании плохих практик. Эти подходы формируют уникальный ландшафт современных нейросетевых интерфейсов.

# Как модели научились хорошему дизайну: разбор лидеров Design Arena

Недавно команда бенчмарка Design Arena, специализирующегося на оценке генеративных способностей ИИ, опубликовала масштабное исследование. Эксперты проанализировали работы трёх ключевых моделей: GPT-5.6 Sol от OpenAI, Kimi K3 от Moonshot AI и прошлого лидера GLM 5.2. Целью стало понять, как именно алгоритмы воспринимают понятие «хороший дизайн» и какие методы используют для его достижения.

Страх перед штампами: феномен GPT-5.6 Sol

Для оценки качества генерируемых сайтов используется методология «слепых тестов» на арене Web Design. Пользователи видят две версии одного сайта и голосуют за лучшую. Раньше доминирующей проблемой был так называемый «типичный ИИ-дизайн» или «design smells» — набор визуальных клише: фиолетово-синие градиенты, бento-сетки из скругленных карточек и гигантская типографика вместо фотографии. Дизайн Arena ввел термин «design smells» для обозначения этих штампов.

Модель GPT-5.6 Sol, релиз которой совпал с этим исследованием, заняла первое место в рейтинге Elo (Web Design Non-Agentic), набрав 1353 балла. Это на 18 позиций выше её предшественницы GPT-5.5. Анализ 1000 сайтов, сгенерированных моделью, выявил интересную особенность. Исследователи создали карту дизайн-пространств с помощью алгоритма UMAP и CLIP-эмбеддингов.

Карта показала странные пустые зоны — «дыры», окруженные генерациями со всех сторон. В этих зонах отсутствуют сайты с классическими «дизайн-запахами», которые так популярны в общедоступных генерациях. Гипотеза исследователей подтвердилась: модель GPT-5.6 Sol не просто избегает плохих шаблонов, она их "знаточная" и активно подавляет. Она понимает, как выглядят стандартные штампы, и сознательно отклоняется от них, сохраняя при этом вариативность в остальном пространстве решений.

Стоит отметить, что модель не стала идеальной: в 26,5% генераций всё же появляются конфетти, а реалистичные графики через chart.js ей даются с трудом. Однако стратегия подавления штампов работает: модель научилась отличать эстетически приятное от того, что просто «так принято у ИИ».

Трата токенов ради идеальной картинки: стратегия Kimi K3

Второй объект анализа — модель Kimi K3, ставшая лидером в соревновании single-shot Frontend Arena с рейтингом 1408. Её стратегия кардинально отличается от подхода OpenAI. При выполнении простых одношаговых задач Kimi K3 расходует практически в четыре раза больше токенов на рассуждения по сравнению с предшественницей Kimi K2.7 Code.

Анализ цепочек рассуждений показал, что модель симулирует работу полноценного ИИ-агента. Вместо того чтобы сразу выдать результат, Kimi K3 проводит внутреннюю многостадийную работу: планирует проект, принимает решения и проектирует отдельные компоненты с виртуальными итерациями. При этом объем кода, который модель пишет в своем внутреннем размышлении, в 10 раз превышает объем текста рассуждений.

Ключевой момент исследования касался работы с изображениями. Обычно нейросети не рисуют картинки, а вставляют ссылки на внешние ресурсы, например, фотосток Unsplash. Ссылка содержит уникальный идентификатор (ID), который должен вести на реальное изображение. Если ID неверен, на сайте появляется серый квадрат.

В отличие от других моделей, использующих поиск или случайный подбор, Kimi K3 демонстрирует феноменальную «память интернета». Модель не ищет картинки, а вспоминает их ID наизусть. За время обучения нейросеть связала идентификаторы с семантикой («этот ID — это закат над горами») и проговаривает их во время генерации, как человек называет номер телефона перед звонком. Благодаря этому в разобранных примерах у Kimi K3 не нашлось ни одной битой или нерелевантной картинки, в то время как конкуренты часто вынуждены были использовать текстовые заглушки.

Третий путь: когда штампов просто не существует

Исследователи также изучили модель GLM 5.2, которая ранее лидировала. В дизайн-пространстве этой модели отсутствуют «дыры», соответствующие штампам. Это связано с тем, что модель GLM 5.2, судя по всему, просто не выучила эти антипаттерны. Она работает по принципу набора удачных шаблонов, в которых проблемных визуальных решений изначально мало. Это делает её дешевой и простой в использовании, но не всегда способной к глубокой переосмыслению композиции.

Таким образом, анализ показал, что универсального рецепта хорошего дизайна не существует. На одном и том же бенчмарке сосуществуют три рабочие стратегии:

1. GPT-5.6 Sol: активно подавляет «дизайн-запахи», обучаясь на плохом опыте, но платит за это сложностью некоторых задач (например, графиков). 2. Kimi K3: итерирует в голове, симулируя работу агента, что обеспечивает качество за счет повышенного расхода ресурсов (токенов и времени). 3. GLM 5.2: избегает штампов интуитивно, так как их не усвоила, но остается более примитивной в структуре решений.

Эти находки раскрывают, как искусственный интеллект осваивает эстетические нормы. Модели не просто копируют стиль, а формируют собственные стратегии восприятия и порождения визуального контента, что открывает новые горизонты для автоматизации дизайна.

Первоисточники

Habr AI
← Вернуться в эфир