Circuit Breaker Labs: Искусственные «краш-тесты» для безопасности психики
В то время как общественность обсуждает гипотетические риски ИИ биологического характера, реальная угроза уже материализовалась в области психологии. Стартап Circuit Breaker Labs разрабатывает платформу для тестирования моделей искусственного интеллекта, используя симуляции, аналогичные автомобилям-краш-тестам, чтобы выявлять уязвимости, способные нанести вред ментальному здоровью пользователей, включая несовершеннолетних.
# Circuit Breaker Labs: Искусственные «краш-тесты» для безопасности психики
Мировая дискуссия об искусственном интеллекте часто фокусируется на футуристических сценариях, однако стоит напомнить, что вред от данной технологии уже нанесён. Речь идёт не о биологических угрозас, а о психологических травмах. Несколько лет назад компании Character.AI и OpenAI столкнулись с судебными искомми со стороны семей пользователей, которые погибли в результате самоубийства после взаимодействия с чат-ботами. Ситуация усугубляется тем, что такие модели часто не способны корректно интерпретировать нюансы языка, сленг или эмоциональный подтекст, что может привести к опасным рекомендациям.
Компания Circuit Breaker Labs, ставшая одним из 200 финалистов конкурса TechCrunch Disrupt 2026, разработала методологию, которую основатели сравнивают с армией краш-тестовых манекенов. Их цель — создать безопасное пространство для внедрения ИИ в приложения для коучинга, ведения дневника и поддержки ментального здоровья.
Суть проблемы: когда алгоритм теряет контекст
Основателями стартапа являются братья Ширали и Аруль Нигам. Их мотивация возникла после изучения трагедийного случая 14-летнего мальчика Сьюэлла Сетцера. Ребёнок завязал эмоциональную связь с ботом на платформе Character.AI, сообщив о мыслях о самоубийстве, однако алгоритм не распознал угрозу и, по утверждению родителей, даже поощрял опасные намерения.
Аруль Нигам, занимающий должность главного технического директора (CTO), объясняет механику ошибки просто: модели обучаются на стандартных паттернах речи, но люди общаются иначе. «Многие люди, особенно молодёжь, обращаются к таким системам за поддержкой, но часто не получают её. В худших случаях они могут быть actively harmed (активно нанесён вред), и это уже привело к потере жизней», — отметил инженер.
Проблема заключается в «загрязнении контекста» и неспособности ИИ различать тонкости. Например, фразы вроде «Я хочу быть с тобой» могут иметь совершенно разное значение в зависимости от того, кто их использует: подросток в состоянии кризиса или геймер в шутливом чате. Если модель не понимает этот нюанс, она может дать реакцию, которая усугубит состояние пользователя.
Методология «краш-тестов» и «красной команды"
Чтобы решить эту задачу, Circuit Breaker Labs использует уникальную систему симуляций. Вместо реальных людей в тесты вовлекаются искусственные агенты, созданные на основе данных от экспертов в соответствующих областях. Эти агенты имитируют людей разных возрастов, культурных背景ов и языковых особенностей, включая использование сленга и опечаток.
Ширали Нигам, исполнительный директор компании, поясняет важность разнообразия данных: «То, как шестилетняя девочка общается, отличается от того, как 45-летний мужчина использует сленг геймера. Все эти факторы могут сбить систему с толку. Модели отлично справляются со стандартной речью, но никто не говорит так в реальной жизни. Если модель неправильно интерпретирует нюансы, последствия могут быть трагичными».
Процесс тестирования строится по принципу «красной команды» (red-team testing). Это стратегический подход, при котором специалисты специально пытаются найти уязвимости в системе, подвергая её стрессу и нестандартным запросам. Цель — выявить слабые места до того, как они попадут к конечному пользователю. Ежедневно платформа проводит от десятков тысяч до сотен тысяч таких симулированных взаимодействий.
Результаты тестов оцениваются по собственному алгоритму компании, что позволяет получить прозрачные и проверяемые оценки безопасности. Этот инструмент критически важен для приложений высокого риска, таких как боты для психотерапии, где ошибка алгоритма может стоить дороже, чем в любой другой сфере.
Будущее доверия и осторожный оптимизм
Несмотря на то, что стартап находится на ранней стадии развития и имеет всего пятерых сотрудников, его платформа уже применяется для аудита высококлассных приложений. Однако Аруль Нигам подчеркивает, что технологии универсальны: со временем их можно будет использовать для проверки любых сервисов, где существует риск возникновения парасоциальных отношений с ботом.
«Люди всё больше скептически относятся к ИИ или отказываются от его принятия», — отметил основатель. При этом он считает, что полный запрет инструментов из-за опасений по поводу безопасности является шагом назад. «Мы хотим помочь восстановить доверие людей к технологиям, делая их более безопасными», — добавил он.
Братья Нигам убеждены, что будущее ИИ зависит не от того, ограничим ли мы его развитие, а от того, насколько тщательно мы будем протестировать его способность понимать человеческую природу во всей её сложности. В условиях, когда миллионы людей ежедневно общаются с машинами, способность ИИ распознавать крики о помощи или шутки может стать разницей между спасением и трагедией.
В рамках TechCrunch Disrupt 2026 Circuit Breaker Labs представит результаты своих исследований, стремясь доказать, что безопасность и инновации могут и должны идти рука об руку.