Компьютерное зрение нового поколения: TAPe+ML v3 превосходит гигантов при менше 100 тысячах параметров
Команда ComEx представила новую архитектуру TAPe+ML v3, объединившую в одном компактном ядре классификацию, детекцию и сегментацию объектов. Согласно статье на arXiv, модель с менее чем 100 тысячами параметров демонстрирует показатели, превосходящие крупные SOTA-решения (RF-DETR, YOLO) в стандартных бенчмарках и показывая выдающуюся эффективность в сложных промышленных сценариях.
# Компактное компьютерное зрение: TAPe+ML v3 меняет парадигму развёртывания на edge
Развитие искусственного интеллекта часто сталкивается с дилеммой: чтобы достичь высокой точности, необходимы огромные модели с миллиардами параметров, требующие мощных серверов. Однако технология TAPe+ML v3 от компании ComEx доказывает, что качественно эффективные алгоритмы могут быть упакованы в ядро размером менее 100 тысяч параметров. Статья, опубликованная на arXiv, демонстрирует результаты, которые ставят новые рекорды в задачах классификации, обнаружения объектов (object detection) и сегментации (instance segmentation).
Ниже представлен анализ ключевых данных и результатов, опубликованных авторами.
Рекордная точность при экстремальной компактности
В основе архитектуры TAPe+ML лежит идея создания единого ядра (backbone), способного решать несколько задач одновременно. При этом размер самого ядра составляет менее 100 тысяч параметров. Для сравнения: современные фундаментальные модели (foundation models) часто содержат миллиарды весов. TAPe+ML v3 достигает показателей, сопоставимых с гигантами, но в десятки раз занимая меньше места и ресурсов.
На стандартном наборе данных ImageNet-1k модель показала точность 88,1% (Top-1 accuracy). Это результат, который обычно достигается моделями колоссального масштаба. Более того, TAPe+ML стабильно работает на сдвинутых распределениях данных, что подтверждается результатами на тестах с искусственными искажениями (ImageNet-R, ImageNet-Sketch), где модель также продемонстрировала высокую точность.
Особый интерес представляет сравнение качества данных. В эксперименте на Imagenette (набор мелких изображений) использовалась одна и та же нейросеть с тремя слоями, но разными входными данными: сырые пиксели против преобразованных данных TAPe. Результат разделился почти вдвое: обучение на данных TAPe дало 92% точности, тогда как на сырых пикселях — лишь 47%. Это свидетельствует о том, что предложенный метод представления данных сам по себе является мощным фактором эффективности.
Детекция и сегментация: бьет рекорды YOLO и RF-DETR
В задачах реального времени критически важны два фактора: точность и скорость обработки кадра (inference time). Тестирование проводилось на объектном детекторе (COCO dataset).
Ключевые метрики TAPe+ML v3: * mAP50: 84,7% (точность определения наличия объекта). * mAP50–95: 65,3% (точность локализации границ объекта). * Время обработки: 10,8 мс на кадр при использовании видеокарты NVIDIA GTX 1070 Ti (8 ГБ).
Для контекста сравнения приводятся результаты других известных моделей. RF-DETR-2XL с 126,9 млн параметров показывает mAP50–95 на уровне 60,1%. YOLO11-M с 20,1 млн параметров достигает 48,6%. TAPe+ML v3 с менее чем 0,1 млн параметров превосходит и тяжелые модели по точности, и легкие — по качеству детализации, сохраняя при этом конкурентоспособное время ответа.
В части сегментации (instance segmentation), где задача сложнее — не просто найти объект, но и точно расставить его границы (маски) — TAPe+ML также показывает лидирующие результаты. На датасете COCO модель достигла Mask mAP50–95 равного 58,4%, опередив специализированные версии RF-DETR-Seg и YOLO26-X-Seg. Это позволяет использовать единое ядро для задач, где ранее требовались сложные конвейеры из нескольких сетей.
Скорость индекса видео: порядок разницы с альтернативами
Одна из самых впечатляющих возможностей TAPe — работа с видеопотоками в режиме реального времени. В эксперименте модель использовалась для разбиения видео на смысловые сцены (scene segmentation). Сравнивались методы: TAPe, DINOv2, HOG (Histogram of Oriented Gradients) и Optical Flow.
На одном часе видео: 1. TAPe: построил индекс за 10–11 секунд при объеме данных менее 1 МБ. Кластеризация заняла около 1 секунды. 2. DINOv2: индексировал видео более 5200 секунд (почти в 475 раз дольше), а кластеризация занимала 21,5 секунды. Объем индекса не сравнивался напрямую, но DINOv2 требует значительно больше вычислительной мощности. 3. HOG: построил индекс за 530 секунд, а кластеризация заняла 2226 секунд.
Разница в скорости и компактности настолько велика, что делает использование TAPe на мобильных устройствах или в ограниченных по памяти системах практически единственным рациональным выбором для задач видеоаналитики.
Промышленный пилот: победа в OOD-задаче
В реальной промышленности условия работы часто не соответствуют стандартным наборам данных типа COCO. Объекты могут иметь нетипичное освещение, фон, форму или находиться в нестандартных положениях (сценарий OOD — Out-of-Distribution). Примером послужила задача распознавания засорений руды на конвейере.
Эксперимент был поставлен на крайне малом датасете: всего 30 изображений. YOLO26s в этих условиях показал точность около 28%. TAPe+ML, обученная только на «голове» (классификационной части), достигла 45%. Однако после адаптации самого ядра (backbone) точность выросла до 65% на тех же 30 изображениях. При увеличении датасета до 500 изображений результат поднялся до диапазона 85,7–96%.
Этот кейс иллюстрирует важность адаптации архитектуры под новый домен, а не просто подключения новой классификационной головы. Если ядро было обучено на бытовых данных, оно может быть предвзято. TAPe+ML позволяет корректно работать с такими данными после обучения backbone, что критично для надежного промышленного внедрения.
Экономичное развертывание и автоаннотация
Главное практическое преимущество — возможность развертывания модели на устройствах с ограниченными ресурсами: камерых, роботах, БПЛА или в изолированных корпоративных сетях (on-premise). Размер весов TAPe+ML v3 составляет менее 32 КБ. Полный исполняемый пакет с библиотеками занимает около 10 МБ, что позволяет устанавливать решение даже на старое аппаратное обеспечение.
Время прохождения полного конвейера (детекция + классификация + сегментация + постобработка) составляет около 12 мс на изображение.
Для ускорения сбора данных авторами разработан режим автоаннотации. Модель проходит по неразмеченным данным и предлагает предсказания. Эксперт не рисует bounding box с нуля, а лишь корректирует предложенную моделью маску или класс. Это позволяет быстро собрать обучающую выборку для сложных задач, где ручная разметка традиционно занимала много времени и требовала участия узких специалистов.
Заключение
Технология TAPe+ML v3 демонстрирует, что в компьютерном зрении важнее не количество параметров, а качество архитектуры и метода представления данных. Совместив эффективность фундаментальных моделей и компактность микро-контроллеров, инженеры получают инструмент, способный работать в самых требовательных условиях, от лабораторных тестов до производственных линий. Исследование опубликовано на arXiv под заголовком "TAPe+ML: A Compact Structured Representation for Multi-Task Computer Vision".