Рекуррентная трансформация: как GPT-6 Astra меняет архитектуру генерации текста
OpenAI представила модель GPT-6 Astra, в которой ключевой инновацией стала рекуррентность по глубине: модель проходит вычисления по одному и тому же набору слоев несколько раз, прежде чем сгенерировать следующий токен. Этот подход, известный как «looped transformer», позволяет достигать качества глубоких сетей при меньших затратах на обучение и открывает новую парадигму в создании искусственного интеллекта.
# Рекуррентная трансформация: как GPT-6 Astra меняет архитектуру генерации текста
Вчера компания OpenAI анонсировала релиз модели GPT-6 Astra. В пресс-релизах и комментариях высокопоставленных сотрудников, включая сооснователя Greg Brockman, модель названа самой умной и выровненной из когда-либо созданных, а также потенциальной версией общего искусственного интеллекта (AGI). Особое внимание вызвали заявления о кибербезопасности: Astra стала первой моделью, получившей рейтинг «Critical» в системе оценки готовности OpenAI, что означает способность находить неизвестные уязвимости и разрабатывать эксплойты автономно.
Однако, за громкими обещаниями и тревогами специалистов по безопасности скрывается более фундаментальная техническая смена парадигмы. Впервые в продакшене OpenAI радикально изменила механизм рождения слова: вместо однократного прохода информации через слои нейросети, модель теперь использует многократные итерации над одним блоком.
Что такое рекуррентная глубина в трансформерах
Чтобы понять новшество Astra, необходимо обратиться к базовой архитектуре, которую иронично называют «трансформером». Термин происходит от ключевой операции модели: она «трансформирует» исходные данные, прогоняя их через стопку вычислительных слоев.
Процесс генерации текста у современных моделей работает по принципу предсказания следующего токена. Механизм внимания (*attention*) анализирует контекст, а внутренние блоки извлекают скрытые знания, связанные с темой. Полученный результат преобразуется в новое слово. Обычно для повышения точности используется «глубина» (depth): слово проходит через множество последовательных слоев снизу вверх. Чем больше слоев или чем они толще, тем «умнее» считается модель. Традиционно увеличение интеллекта означало простое масштабирование числа слоев или параметров.
Генерация текста в классическом трансформере происходит за один проход по стопке слоев.
В GPT-6 Astra используется архитектура, которую специалисты называют looped transformer или «зацикленный трансформер». В этой модели стопка слоев достигает своего конца, но не выпускает результат наружу. Вместо этого данные отправляются обратно на вход того же набора слоев. Модель «кружит» над информацией несколько раз, уточняя результат на каждой итерации. Только после завершения всех назначенных кругов слово формируется и выдается пользователю.
Авторская ремарка: Представьте, что вы заучиваете сложную строку стихов. В обычной модели вы произносите её сразу, опираясь на то, что успели запомнить за пару попыток. В модели Astra вы шепчете строку про себя, пересматриваете, подправляете акценты, прокручиваете её во второй и третий раз в голове, и только потом громко, уверенно произносите вслух.
Хотя идея рекуррентности (возврат данных в цикл) была популярна до возникновения трансформеров, последние десятилетия доминировали именно последовательной архитектурой. Однако в Astra рекуррентность возвращается, но не по времени (как в старых сетях RNN), а по глубине вычислений. Это позволяет сохранить параллельность обработки внутри слоев, сохраняя при этом способность к «мышлению» до генерации ответа.
Экономика обучения и новая гибкость
Главное преимущество этого подхода кроется не столько в скорости вычислений, сколько в экономии на этапе обучения моделей. В традиционных моделях количество слоев фиксировано: оно задается раз и навсегда при обучении и инференсе. Чтобы обучить модель глубже, нужно создать больше слоев.
В архитектуре с петлей модель проходит цикл из заданного числа кругов. Параметры весов сохраняются в том же объеме, но вычислительная сложность меняется в зависимости от числа итераций. Это позволяет достигать результатов глубоких моделей, используя меньшее количество параметров видеопамяти, компенсируя затраты лишь дополнительным временем на инференс.
Особенно интересен метод обучения, примененный в открытых исследованиях, связанных с этой архитектурой (например, проект Huginn). Во время обучения модель не знает заранее, сколько кругов она должна проделать. Это число выбирается случайно из распределения (например, логнормального или Пуассона). На одном шаге модель может пройти 4 круга, на другом — 90.
Градиент (методика обновления весов) рассчитывается только по последним восьми кругам, что аналогично усеченному обратному распространению во времени (BPTT), но применено здесь к глубине. Благодаря этому потребление памяти на шаге обучения становится независимым от общего числа кругов, что критически важно для масштабируемости.
Этот сдвиг парадигмы позволяет рассматривать количество кругов не как жесткий архитектурный параметр, а как настраиваемую гиперпараметру во время работы модели. Пользователь или система может решить, требуется ли быстрый ответ (4 круга) или максимально точный и взвешенный (до 32 кругов и более), используя одни и те же веса модели.
Результаты бенчмарков: кривая эффективности
Тесты одной модели с разным числом кругов показывают впечатляющую динамику: * 4 круга: 49% верных ответов на вопросах ARC-E. * 8 кругов: 65%. * 16 кругов: 69,5%. * 32 круга: 69,9%.
После 32-го круга прирост производительности практически исчезает, что указывает на плато эффективности. Важно отметить, что «думать дольше» в этой архитектуре означает не просто генерацию большего объема рассуждений в тексте, как это делается в некоторых агентах, а усиление обработки информации внутри скрытых слоев перед выпуском токена.
Важно также отметить, что подобные исследования проводились ранее. Например, работа SMELT (сентябрь 2024 года) продемонстрировала, что при выровненном бюджете вычислений зацикленные модели экономят 7–18% обучающих ресурсов по сравнению с обычными трансформерами, особенно в задачах программирования. Механизм этого улучшения связан с подавлением «стока внимания» (*attention sink*) — явления, когда модель нерационально фокусируется на начальных словах последовательности из-за отсутствия контекста. Второй проход по слоям перенаправляет внимание к смысловым элементам.
Вопросы безопасности и прозрачность
Принципиальная смена архитектуры вызвала беспокойство в научном сообществе. Бак Шлегерис (Redwood Research) и Райан Гринблатт (Redwood Research) выразили обеспокоенность тем, что часть процесса рассуждений может оставаться «в черновике» — в скрытых активациях модели, недоступных для анализа человеком. Это создает риски, связанные с безопасностью и интерпретируемостью ИИ.
С другой стороны, Себастьян Рашка и эксперты из OpenAI отмечают, что переиспользование слоев само по себе не скрывает рассуждения, а лишь переносит их в скрытое пространство до момента выдачи. Главное изменение, по их мнению, заключается в том, что модели больше не поощряются к написанию длинных цепочек рассуждений. Награда дается только за верный итог, а процесс достижения этого итога остается внутри «черного ящика».
Якуб Пахоцкий из OpenAI уточнил, что глубина вычислительного графа в фронтир-моделях, включая Astra, укладывается в двойные пределы по сравнению с GPT-4, и что петля намеренно ограничена для обеспечения возможности мониторинга.
Итоги и честная статистика
Скептики указывают на разрыв в цифрах, приведенных OpenAI. Если модель показала 99,9% точности на харнессе (системе тестирования) собственной разработки, то на независимом стандарте ARC Prize та же модель набрала 62,7%. Разница составляет 37 процентных пунктов, что свидетельствует о необходимости осторожности в интерпретации рекламных показателей.
Согласно анализу Artificial Analysis, по общему индексу интеллекта GPT-6 Astra занимает положение между GPT-5.6 Sol и Claude Fable 5.1. Несмотря на это, модель демонстрирует заметное преимущество в экономических показателях и эффективности при решении агентских задач.
Таким образом, GPT-6 Astra представляет собой не просто очередной шаг в эволюции нейросетей, а фундаментальный возврат к рекуррентности, реализованный в условиях параллельной архитектуры. Это возвращение к идеям 2018 года и более ранних исследований, которые ранее не могли быть применены в продакшене из-за технических ограничений. Индустрия, от которой уходили рекуррентные сети десять лет назад, тихо возвращается, но уже по новой, более эффективной траектории.
В будущем, вероятно, мы увидим гибридные модели, которые будут динамически выбирать глубину рекурсии в зависимости от сложности задачи, балансируя между скоростью ответа и точностью рассуждений.