Искусственный интеллект · Астрономия · Фундаментальные модели · Данные · Машинное обучение29 августа в 11:03 · 4 мин

Карта переписывает пиксели: как обнаружение объектов искажает работу астрономических ИИ

Новое исследование показывает, что фундаментальные модели искусственного интеллекта в астрономии могут систематически ошибаться не из-за нехватки вычислительной мощности, а из-за метаданных о том, где объекты были зафиксированы датчиками. Авторы работы, опубликованной на arXiv, продемонстрировали, что «дверь обнаружения» — простой факт наличия разметки объекта в центральной части поля снимка — имеет куда большее влияние на прогноз модели, чем сама информация о свете, который объект излучает. Это приводит к существенным искажениям в измерении красного смещения.

Голографическая линза над глубоким морем искажает звезды

# Карта переписывает пиксели: как обнаружение объектов искажает работу астрономических ИИ

Фундаментальные модели искусственного интеллекта (Foundation Models), используемые в современной астрономии, обучаются на огромных массивах данных, включающих не только изображения звезд и галактик, но и каталоги их характеристик, сгенерированные из этих же изображений. Казалось бы, такой подход должен повышать точность. Однако новая работа исследователя Игора Кендюхова (Ihor Kendiukhov) выявляет критическую уязвимость: если каталоги содержат погрешности или пропускают объекты, модель не просто наследует эти ошибки, она строит на их основе ложную картину реальности.

Центральным открытием исследования является то, что «канал обнаружения» — метаданные, сообщающие модели, что на определенном участке пикселей находится объект — имеет приоритет над визуальной информацией. В экспериментах с моделью AION-1, обученной на более чем 200 миллионах объектов, изменение только карты сегментации (с указанием, какие пиксели относятся к объекту), при полном сохранении самих изображений, приводило к изменению всех прогнозируемых величин — от потока излучения и размера до красного смещения — в разы. В некоторых случаях это изменение достигало более 4000 процентов по сравнению с контрольными данными.

Механизм «включения» и центра поля

Основная причина таких аномалий была названа авторами «дверью обнаружения» (detection gating). Модель работает не как нейронная сеть, ищущая паттерны света на изображении, а скорее как система, реагирующая на флаг присутствия объекта в базе данных. Исследования показали, что наличие флага обнаружения в центральной части поля снимка (радиус r = 0.47) оказывает значительно большее влияние на выводы модели, чем количество света, заключенное в границах маски сегментации (r = 0.30).

Дополнительно было установлено, что модель практически игнорирует детали того, как программные алгоритмы (пайплайны) разделяют свет смешанных объектов. В тесте на 322 реальных случаях наложения объектов корреляция между поведением модели и реальным разделением света составила практически ноль (R = -0.006). Более того, предоставление несоответствующих данных фотометрии (измерения яркости) из каталога делало прогнозы модели в девять раз хуже, чем полное отсутствие любых метаданных о яркости. Это свидетельствует о том, что сам факт наличия «галочки» о наличии объекта в центре кадра является доминирующим фактором принятия решений.

Проблема усугубляется тем, что существующие пайплайны обработки данных, такие как Legacy Survey, пропускают около 3,68% целей, не формируя для них сегментацию. Когда исследователи смоделировали ситуацию, при которой пропущенные объекты заменяются данными из фактически возвращаемого поля пайплайна, влияние на красное смещение стало критическим. Медианное смещение среднего красного смещения составило 0,71 от требуемого стандартом LSST DESC, превысив нормативы в 12 из 40 случаев. В худшем сегменте наблюдаемые погрешности положения объектов выросли в 8,3 раза.

Важно отметить, что спектроскопия, которая предоставляет независимые измерения скоростей объектов, полностью устраняет этот эффект. Также было подтверждено, что удаление канала обнаружения из входных данных модели не несет измеримых дополнительных издержек, в то время как ошибка растет по мере увеличения масштаба самой модели.

Ограничения кодирования и токенизации

Помимо логики обнаружения, исследователи выявили технические ограничения, налагаемые процессом перевода данных в формат, понятный нейросети (токенизация). Кодировщик изображений в используемой модели способен разрешить лишь 28 эффективных состояний для отдельных участков источника, в то время как аналогичный кодировщик для спектральных данных справляется со 1534 состояниями. Кроме того, вывод красного смещения ограничен квантованием данных.

Попытки использовать разреженные словари как надежный инструмент для вмешательства в работу модели оказались безуспешными. В тестировании на 15 различных наборах данных успешное восстановление входных данных варьировалось от 26% до 75%, причем результат мог смещаться на целых 18 пунктов даже при изменении только начального семени (seed) генератора случайных чисел. Это указывает на нестабильность методов каузальных интервенций (причинных вмешательств) в данной области.

Значение для науки

Работа подчеркивает, что в эпоху применения фундаментальных моделей к астрономическим данным невозможно доверять исключительно их внутренним механизмам. Ошибки на этапе первичной обработки изображений и формирования каталогов не просто копируются, они умножаются благодаря архитектурным особенностям нейросетей. Для таких масштабных проектов, как Обсерватория Веры Рубин (LSST), где требуется предельная точность измерения красного смещения для понимания истории расширения Вселенной, учет метаданных обнаружения становится не второстепенным фактором, а центральной задачей качества данных. Пока канал обнаружения не будет откалиброван или исключен из логики принятия решений, пиксели будут оставаться лишь фоном для истинного диктата карт.

Первоисточники

arXiv cs.AI
← Вернуться в эфир