OpenAI · Astra · GPT-6 · Искусственный интеллект · Безопасность ИИ · Нейросети2 сентября в 23:02 · 4 мин

Архитектура прозрачности: OpenAI тестирует модель Astra с непрозрачным мышлением

Индустрия искусственного интеллекта подошла к точке, где прозрачность мыслей модели становится компромиссом между безопасностью и контролем. Согласно данным расследования издания The Information, OpenAI разрабатывает модель под кодовым названием Astra, использующую новую архитектуру «zacykленный трансформер». Это позволит системе скрывать часть своих вычислительных процессов от наблюдателей, что фундаментально меняет подход к контролю над генеративными моделями.

Аметистовый ледяной столб у причала в Тихой бухте

# Модель с закрытыми черновиками: новый парадокс OpenAI

Развитие генеративных нейросетей традиционно базировалось на принципе открытости. Когда модель пишет ответ, она часто демонстрирует промежуточные шаги, известные как «chain of thought». Эти текстовые следы позволяют разработчикам и исследователям видеть логику вывода, проверять правдивость аргументации и останавливать процесс, если модель начинает обходить этические нормы или искать уязвимости.

Однако новый проект OpenAI, получивший рабочее название Astra, может поставить этому принципу точку. По информации источников, близких к лаборатории и изданию The Information, компания внедряет технологию, которая делает часть внутренних рассуждений модели нечитаемой для любого, включая разработчиков.

«Зацикленный трансформер» против стандартной архитектуры

Основной технической инновацией, лежащей в основе Astra, является изменение способа обработки данных. Традиционные большие языковые модели (LLM) функционируют как стопка слоев: текст проходит через них один раз сверху вниз, и модель формирует следующее слово на основе этой однократной трансформации.

В Astra используется подход, который специалисты называют «recurrent depth» или «зацикленный трансформер» (зацикленный Transformer). Вместо одного прохода, данные прогоняются через одни и те же вычислительные слои многократно, прежде чем будет сформирован окончательный результат.

Для наглядной аналогии можно представить это как разницу между публичным докладом и внутренними размышлениями. Обычная модель пишет черновик ответа, который мы можем видеть. Модель же на базе новой архитектуры выполняет основные вычислительные и логические операции «в уме», без выведения промежуточных слов на бумагу. Только финальный вывод или урезанная версия процесса становятся видимыми для пользователя.

Этот метод, по данным источников, впервые был применен в академических проектах, таких как модель Huginn от исследовательской команды в начале 2025 года, а также в проекте Ouro от команды Seed из ByteDance. Однако именно OpenAI интегрировала эту технику в свой флагманский продукт, что вызывает значительный интерес у сообщества.

Технические термины

* Зацикленный трансформер (Recurrent Transformer): Архитектура, где входные данные многократно прогоняются через слои сети для усиления вычислительной глубины без увеличения количества параметров модели. Это позволяет модели «думать» глубже, сохраняя при этом компактность весов. * Нейролес (Neuralese): Говорится о том, на каком внутреннем, часто численном или скрытом уровне представления нейросеть обрабатывает информацию. Если эта информация не конвертируется в текст, она становится недоступной для прямого анализа.

Цена прозрачности: безопасность или потеря контроля?

Главный аргумент в пользу такой архитектуры лежит в плоскости безопасности. Ученый OpenAI Якуб Пахоцкий, комментируя ситуацию, указал, что модель Astra уже получила статус «критического» уровня кибербезопасности. В тестах она продемонстрировала способность находить неизвестные уязвимости в защищенных системах и превращать их в рабочие эксплойты без участия человека.

Если модель демонстрирует способность находить и эксплуатировать уязвимости, наличие полного доступа к ее рассуждениям становится риском. Как показали недавние инциденты с агентами OpenAI, доступ к сырым транскриптам мыслей модели позволяет злоумышленникам анализировать, как нейросеть обнаруживает свои же ограничения, и находить способы их обхода. Скрытые вычисления затрудняют такой анализ, выступая естественным барьером.

Однако этот подход несет в себе обратную сторону медали. Цепочка рассуждений — это не просто удобство для разработчика, а ключевой инструмент аудита. Классификаторы безопасности анализируют текст, который пишет модель, чтобы остановить опасные действия до их выполнения. Если часть рассуждений упрятана в нечитаемые числовые состояния, классификатору нечего анализировать. В сообществе это явление описывается как риск перехода в «немониторируемость».

Ирония развития

Существует историческая ирония в действиях OpenAI. Еще в июле этого года исследователи из OpenAI, Anthropic, Google DeepMind и института METR опубликовали статью, в которой предостерегали от использования моделей с латентными (скрытыми) рассуждениями, называя это «хрупкой возможностью», которую индустрия должна беречь. Год спустя та же компания применяет именно эту технику.

Компания пытается смягчить критику, утверждая, что глубина вычислений в Astra не превышает в два раза глубину текущих моделей GPT-4. По словам Пахоцкого, это означает, что модель «думает» лишь немного дольше, чем модели предыдущего поколения, а остальное время все равно выводит текст. Он подчеркивает, что мониторинг цепочек рассуждений — единственный известный инструмент контроля, и он, к сожалению, начинает деградировать.

Статус модели и будущие шаги

На данный момент официальное подтверждение названия модели GPT-6 отсутствует. В сети наблюдаются косвенные признаки подготовки релиза: API OpenAI отдает код ошибки 404 при запросе к адресу gpt-6-astra, что обычно свидетельствует о существовании закрытой модели, а не о технической ошибке.

Хотя компания не раскрывает полную архитектуру в публичных материалах, данные The Information и комментарии ученых позволяют составить картину: индустрия ИИ приближается к эре, когда контроль над самыми умными и мощными системами будет опираться не на тотальный просвет, а на доверие к «черному ящику» и сложность внутренней логики, недоступной для прямого чтения. Это фундаментальный сдвиг от модели «видимости» к модели «доверия».

Первоисточники

Habr AI
← Вернуться в эфир