Сторонний стартап легализует рынок моделей ИИ без фильтров безопасности
Компания Abliteration.ai запустила коммерческий сервис, предоставляющий доступ к открытым моделям искусственного интеллекта, лишенным встроенных механизмов отказа от выполнения поручений. Основатель аргументирует это решение необходимостью уравнивания прав защитников и атакующих в кибербезопасности, однако эксперты предупреждают о рисках распространения вредоносного ПО и биоопасностей.

# Abliteration.ai: бизнес на лишении нейросетей морального компаса
В сфере искусственного интеллекта возникла новая коммерческая ниша, направленная на разрыв между разработчиками и конечными пользователями. Стартап Abliteration.ai, основанный недавно, превратил процесс удаления встроенных ограничений (так называемых «охранителей» или guardrails) из моделей ИИ в доступный продукт. Компания делает упор на то, что доступ к таким «обезоруженным» моделям необходим для эффективного тестирования систем безопасности.
От подполья к облачному сервису
До появления Abliteration.ai практика удаления ограничений была свойственна скорее сообществу энтузиастов и исследователей, действовавшим в подполье или через децентрализованные платформы. На сайте Hugging Face уже насчитывались тысячи модифицированных версий моделей. Однако доступ к ним требовал от пользователей самостоятельной загрузки весов и организации вычислительных ресурсов, что создавало высокий порог вхождения.
Abliteration.ai, официально зарегистрированная в марте, переносит эту практику в формат SaaS (Software as a Service). Платформа размещает модифицированные версии открытых моделей на своих серверах, позволяя клиентам взаимодействовать с ними через веб-браузер или API без необходимости скачивания и настройки локального окружения.
Технология аблитерации (abliteration), используемая стартапом, направлена на устранение у модели тенденции отказываться от выполнения запросов, даже если они потенциально вредны. В интервью изданию TechCrunch сооснователь компании (по желанию не раскрывающий свою фамилию, так как продолжает работать в другой фирме) сообщил о наличии сделок с крупными провайдерами облачных вычислений. Это позволяет компании обслуживать запросы, финансируемые исключительно за счет выручки от клиентов. Финансирование от венчурных инвесторов на данный момент отсутствует, хотя ведутся переговоры.
Примеры работы и двойственные цели
В ходе проверки возможностей сервиса журналисты создали учетную запись и отправили запрос на выполнение Python-скрипта для кражи сохраненных паролей в браузере Chrome, а также на детальную инструкцию по выращиванию опасного патогена человека. Модели, размещенные на платформе, без колебаний сгенерировали запрошенный контент, демонстрируя отсутствие стандартных отказоустойчивых механизмов.
Логика защиты компании проста: нельзя защищаться от угрозы, которую невозможно воспроизвести в контролируемых условиях. Если модель автоматически отказывает генерации эксплойтов, «красные команды» (специальные группы специалистов по тестированию на проникновение) не могут полноценно готовить защиту для банков, авиакомпаний и других критических инфраструктур. По словам сооснователя, клиенты платформы — это в основном ранние стартапы в области красного тестирования в Великобритании и Европе.
«Суть аблитерированных моделей в том, что они позволяют моделировать поведение злоумышленников», — заявил основатель. Это позволяет защитникам действовать с той же скоростью, что и атакующие, и, по его мнению, ускорить развитие кибербезопасности.
Растущие опасения экспертов
Несмотря на аргументацию стартапа, сообщество искусственного интеллекта выражает серьезные обеспокоенности. Адрю Юн (Andrew Yoon), возглавляющий направление исследований в некоммерческой организации по безопасности ИИ CivAI, назвал аблитерацию созданием модели, которая «становится социопатом». По его словам, если система исполняет любые команды без фильтрации, это открывает простор для реального вреда.
«Когда говорят об удалении ограничений, речь идет именно об этом», — заявил Юн. Он ожидает, что в ближайшем будущем такие модели будут использоваться для нанесения ущерба. Независимые подтверждения того, что защитные механизмы убраны не только в сфере кибербезопасности, но и в биологической тематике, также поступили от других специалистов.
Эксперты отмечают, что полностью остановить распространение таких моделей невозможно, так как открытые веса моделей уже доступны для свободного использования. Вместо запрета они предлагают меры регулирования: требование от провайдеров использования классификаторов для блокировки запросов на создание биооружия или вредоносного ПО, а также обязательную верификацию личности пользователей у операторов дата-центров.
Ответственность и пределы регулирования
Abliteration.ai заявляет о наличии собственного слоя модерации. В тестировании, проведенном TechCrunch, модель не выдавала инструкции по суициду, что указывает на сохранение некоторых базовых ограничений. Тем не менее, сооснователь признает, что работа над расширением блокировок действий, приводящих к насилию, продолжается.
Ключевой проблемой остается верификация пользователей. В настоящее время платформа не внедрила процедуры «Знай своего клиента» (KYC), ограничившись лишь фиксацией данных банковской карты. Основатель объясняет сложность принятия решения о том, до какого момента компания берет на себя ответственность за действия клиентов.
Отношение внутри индустрии также неоднородно. Некоторые специалисты по тестированию агентов считают аблитерацию неэффективной для реального вреда, так как удаление ограничений иногда приводит к потере части знаний модели. Другие, включая основателя Armadin, полагают, что публичная доступность таких инструментов критически важна для понимания реального горизонта возможностей ИИ и его опасностей.
Понимание терминов
* Guardrails (Охранители): Встроенные механизмы безопасности в нейросеть, которые анализируют запрос и ответ, блокируя генерацию контента, нарушающего этические нормы или законов. * Open-weight models (Модели с открытыми весами): Архитектуры нейросетей, чьи параметры (веса) доступны для загрузки и модификации любым пользователем без лицензионных ограничений. * Red teaming (Красная команда): Метод тестирования систем безопасности, при котором одна группа специалистов симулирует действия злоумышленников для поиска уязвимостей. * Abliteration (Аблитация): Процесс модификации модели ИИ, направленный на отключение её способности отказывать в выполнении вредных или запрещенных запросов.
На фоне растущей capacidades моделей, доступ к весам которых может быть модифицирован любым пользователем, индустрия и регулирующие органы сталкиваются с острым вопросом: является ли демократизация доступа к нефильтрованным моделям гарантом безопасности или, наоборот, фактором, повышающим риски для общества? Пока что спор продолжается, но доступ к таким инструментам становится всё более легким и очевидным.