XAI · интерпретируемость · компьютерное зрение · нейронаука · разреженные автокодировщики · контурные методы · machine learning24 сентября в 13:02 · 4 мин

Парадокс открытости: почему нейробиологи 1950-х понимали мозг лучше, чем мы — нейросети

За последние 15 лет область объяснимого искусственного интеллекта (XAI) создала мощные инструменты визуализации и атрибуции. Однако, как показывают свежие исследования, эти методы часто отвечают на технические вопросы, но не приближают человека к пониманию внутренней логики модели. Статистика парадоксальна: в 1950-х годах ученые с примитивными инструментами раскрывали фундаментальные законы зрения, тогда как сегодня, имея полный доступ к весам и градиентам, мы все еще не можем уверенно объяснить, как работают современные архитектуры.

# Нейросети открыты, но не понятны: кризис интерпретируемости в 2026 году

В конце 1950-х годов в лаборатории Гарварда команда Дэвида Хьюбела и Торстена Визеля проводила эксперименты над зрительной корой кошек. Используя электроды и слайд-проекторы, они фиксировали реакцию отдельных нейронов на простые полосы света. Никаких суперкомпьютеров не требовалось, но именно эти наблюдения привели к открытию избирательных нейронов и принести авторам Нобелевскую премию.

Сегодня ситуация инвертировалась. В 2026 году мы обладаем абсолютным доступом к внутренностям нейросетей: можем просматривать веса, активации и градиенты в любой точке архитектуры. Тем не менее, как отмечается в новом препринте «From Interpretability Methods to Interpretable Models», мы знаем о принципах работы этих систем куда меньше, чем знали о биологическом мозге шестьдесят лет назад.

Инструменты не всегда ведут к пониманию

За последние пятнадцать лет исследователи объяснимого ИИ (XAI) сосредоточились на совершенствовании методов анализа. Выделилось четыре основных направления:

1. Методы атрибуции: определяют, какие именно пиксели повлияли на решение модели. Эти методы подверглись жесткой критике за низкую надежность и чувствительность к манипуляциям. 2. Визуализация признаков: позволяет увидеть, что активирует конкретный нейрон, синтезируя соответствующие изображения. 3. Концепт-ориентированные методы: вместо анализа отдельных нейронов используют понятные человеку категории. Примеры включают TCAV и современные разреженные автокодировщики (SAE), которые извлекают концепты без заранее заданного списка. 4. Методы на основе контуров: исследуют внутренние алгоритмы, прослеживая цепочки вычислений. Проект Circuits от команды Anthropic показал, как в сети InceptionV1 работают детекторы кривых, а анализ CLIP выявил нейроны, реагирующие и на изображение паука, и на слово «паук».

Казалось бы, прогресс очевиден. Однако в марте 2025 года команда DeepMind опровергла безусловную пользу SAE в конкретной задаче детекции вредоносности лингвистических промптов. Линейная проба активаций показала почти идеальный результат, тогда как SAE проиграл. Это заставило исследователей усомниться в эффективности инструментов, которые они оттачивали годами.

*Как наблюдает спокойный аналитик, мы часто полируем стекло, сквозь которое смотрим на объект, забывая проверить, видит ли оно что-то вообще.*

Несмотря на это, научное сообщество часто спорит о нюансах одного метода, игнорируя главный вопрос: стала ли модель после внедрения этих инструментов понятнее для человека?

Структурное согласие и человеческое понимание

В статье приводится важное различие между двумя задачами, которые часто путают:

* Что модель представляет: задача структурного анализа. Используя кросс-кодировщики и методы сравнения концептов, можно показать, как соотносятся внутренние представления двух разных моделей, не привлекая людей. * Понимают ли люди работу модели: это вопрос, который решается только в ходе проверки на живых пользователях. Простые графики здесь не помогают.

Пример из медицины иллюстрирует риски. Врачи-радиологи доверяли рекомендациям GPT-4, которые выдавали уверенные, но ошибочные обоснования. Формат объяснения создавал иллюзию компетентности, но не соответствовал реальности. Модель могла быть умной и масштабной, но интерпретируемой в смысле «понятной человеку» она оставаться не смогла.

Ловушка автоматизации измерений

Поскольку прямые психофизические эксперименты с людьми дороги и медленны, возник соблазн автоматизировать процесс оценки. Метрика Machine Interpretability Score пытается заменить человека другой моделью, оценивающей сходство восприятия.

Однако такой подход содержит логическую ловушку: измерение интерпретируемости опирается на предположение о том, что люди находят изображения похожими, которое само требуется доказать. Это создает замкнутый круг, где инструмент измерения подтверждает свою собственную валидность, вместо того чтобы отвечать на исходный вопрос.

Почему сейчас момент для перемен

Ситуация напоминает развитие нейробиологии XX века. Ранние инструменты были грубыми, а доступ к мозгу ограничен, но наука шагала вперед кирпичик за кирпичиком, накапливая фундаментальные знания. Сегодня у нас есть «рентген» нейросети, но без системного подхода к определению того, что именно означает «человек понял модель», данные просто перегружают систему.

Архитектурное разнообразие в компьютерном зрении сейчас сокращается: на смену сотням вариантов пришли базовые семейства (Vision Transformer, CLIP и др.). Это дает шанс использовать универсальные методы сравнения. Однако без перехода к строгим определениям «человеческого понимания» интерпретируемость останется утверждением на веру, а не измеренным свойством, необходимым для сертификации и доверия.

До тех пор, пока не появятся независимые оценки в достаточном количестве, мы рискуем продолжать создавать системы, которые технически прозрачны, но интеллектуально непрозрачны.

Первоисточники

Habr AI
← Вернуться в эфир