Новая архитектура для объяснимых визуальных предсказаний на основе концепций
Исследователи представили новую диффузионную модель, которая интегрирует механизм классификации непосредственно в генеративный процесс. Это позволяет создавать контрфактические объяснения для изображений, опираясь на понятные человеку концепции, а не на внешние классификаторы, чувствительные к шуму.
# Контрфактические объяснения с диффузионными моделями: подход, основанный на концепциях
В области искусственного интеллекта и компьютерного зрения растет потребность в системах, способных не только делать предсказания, но и обосновывать их. Особенно актуальным это становится для «критически важных» областей, таких как медицинская диагностика, где ошибка модели может иметь серьезные последствия. Одной из ключевых задач здесь являются визуальные контрфактические объяснения. Они отвечают на вопрос: «Какое минимальное изменение в исходном изображении изменит решение модели?»
Ранее существующие диффузионные методы могли генерировать реалистичные изображения, но их устойчивость под вопросом. Они полагались на отдельные внешние классификаторы, которые должны были работать надежно даже на «загрязненных» изображениях с внесенными изменениями. Это делало их хрупкими и сложными для практического внедрения.
Команда авторов во главе с Яссин Эуслати (Yassine Oueslati) предложила новое решение, описанное в статье arXiv:2607.22544. Новый фреймворк называется C-VCE (Concept-based Visual Counterfactual Explanations). Его главная особенность заключается в том, что классификатор встроен непосредственно в модель генерации через так называемый «слой узких мест концепций» (concept bottleneck layer).
Интеграция концепций вместо внешних классификаторов
Суть инновации кроется в отказе от разделения генеративной и классификационной частей системы. Традиционный подход требовал наличия внешнего классификатора, способного корректно обрабатывать изображения с шумом или небольшими искажениями, которые являются частью процесса поиска контрфактического примера. Такой классификатор часто не справлялся с задачами, требующими высокой точности.
В новой архитектуре C-VCE логика принятия решений заложена внутрь самого процесса генерации. Модель обучается реагировать на семантические понятия (концепции) — например, «наличие очков», «цвет волос», «наличие шапки» — и использует их как направляющие векторы для изменений изображения. Пользователь может включать или выключать определенные концепции в процессе синтеза, и модель минимально корректирует соответствующие области изображения, сохраняя остальную часть нетронутой.
Механизм минимизации изменений
Одной из главных целей контрфактивных объяснений является экономия изменений: нужно изменить как можно меньше пикселей, чтобы поменять мнение модели. Для этого в C-VCE применены специальные техники контроля.
Во-первых, используется простой вероятностный регуляризатор. Он балансирует две цели: с одной стороны, нужно изменить предсказание модели, с другой — сохранить новое изображение максимально близким к оригиналу. Во-вторых, применяется градиентная маска, которая направляет изменения строго в те области изображения, которые действительно влияют на результат. Это позволяет избежать случайных искажений фона или нерелевантных деталей.
Результаты и значимость для безопасности ИИ
Тестирование на бенчмарке CelebA показало, что предложенный подход не уступает, а в некоторых аспектах превосходит существующие решения. Модель обеспечивает сопоставимые или лучшие показатели по частоте смены предсказания (flip rates). При этом генерируемые изображения визуально ближе к исходным и содержат меньше артефактов по сравнению с методами, полагающимися на внешние классификаторы.
Эти свойства делают C-VCE практичным инструментом для систем компьютерного зрения, где пользователям необходимы конкретные изображения-сценарии «что если», не вынуждая их полагаться на дополнительный, потенциально ненадежный классификатор. В более широком смысле результаты работы исследователей указывают на то, что возможность открыть и контролировать внутренний слой концепций является перспективным путем к созданию более понятных и безопасных мощных генеративных моделей.