Критический перерыв в соревновании Pokémon TCG AI: статистический анализ реальной динамики
Несмотря на то, что соревнование Pokémon TCG AI Battle официально застыло после дедлайна 16 августа, анализ данных выявляет устойчивый рост эффективности лучших алгоритмов. За неделю «замороженного поля» средний счет лидера увеличился на 56,4 очка. Однако глубокий разбор показывает, что наблюдаемое улучшение является статистическим эффектом от замены соперников, а не результатом доработки кода агентов.

# Динамика лидерства в период «замороженного поля»
Соревнование искусственного интеллекта по карточной игре Pokémon TCG подошло к финальной черте. На момент закрытия приема решений (16 августа, 23:58:53) система зарегистрировала 6806 команд. Около четверти из них — 1668 участников — отправили свои финальные конфигурации именно в день окончания, что указывает на высокий уровень вовлеченности или, возможно, на последние изменения стратегии в самый сжатый срок.
Организаторы Kaggle традиционно продолжают публикацию дампов сыгранных партий даже после закрытия отправки решений. Этот период, когда алгоритмы не обучаются, а меняется только жеребьевка соперников, является уникальным окном для честной диагностики качества моделей. Для статистика это «контрольный эксперимент» без вмешательства в код, позволяющий отделить реальную эволюцию алгоритма от шума случайных исходов.
Статистическая значимость роста лидера
Анализ среднего счета лучшего агента (top scorer) за семь дней до и после заморозки поля показывает явный тренд.
| Период | Средний счет | | :--- | :--- | 1248.30 | +1304.69 |
Рост составил 56,4 очка при стандартном отклонении около 20. Статистический тест Уэлча (Welch's t-test) подтверждает, что это изменение достоверно: значение t равно ровно 5.0. В контексте научных исследований это считается очень сильной значимостью.
Важно отметить, что в коде агентов не внесено изменений за этот период. Рост демонстрирует, как даже неизменные алгоритмы адаптируются к меняющемуся составу соперников. Изначальный пик сезона, достигнутый 29 июня (1411,13 очков), был временным явлением. Весь июль наблюдалось снижение показателей, и текущий уровень (1335,04) свидетельствует лишь о возврате к форме начала июля, а не о новом рекорде.
Иллюзия роста медианы и расхождения
Исследователь первоначально рассчитывал на подтверждение роста и по медиане поля. Формально медиана увеличилась с 1039,14 до 1062,41 (рост 23,3 пункта). Однако при детальном разборе данных картина усложнилась: внутри той же недели после заморозки медиана провалилась до 963,27 18 августа, а затем выросла до 1082,73 20 августа.
Разброс результатов среди средних команд резко увеличился: с 13,5 очков до заморозки до 59,7 после. Статистический тест не подтверждает значимости этого сдвига (p ≈ 0,32). Более того, разрыв между лидером и серединой полей, который сокращался до 92,15 пункта, после заморозки начал расти. Рост составил 159%, но большая часть этого скачка (плюс 159% всего) произошла до окончания дедлайна, когда участники еще могли оптимизировать свои ботов под лидеров. Добавка после заморозки статистически неотличима от случайного шума.
Методологические ловушки: байты против эпизодов
Анализ данных выявил распространенную ошибку в интерпретации метрик. В индекс соревнований входит колонка с количеством эпизодов за день, которая демонстрировала падение на 40,5%. На первый взгляд, это свидетельствует о снижении активности участников. Однако фактический объем ежедневных дампов остался неизменным — около 20 ГБ.
Средний размер партии вырос на 68% (с 2,746 МБ до 4,613 МБ), что объясняет снижение количества эпизодов при постоянном объеме данных. Корреляция между количеством эпизодов и размером на эпизод показывает почти идеальную обратную зависимость (r ≈ -1), но это тривиальный математический тавтологизм, а не доказательство закономерности. При вычислениях необходимо нормировать данные по байтовой квоте, а не по сырому числу эпизодов.
Двойная шкала оценок: таблица против дампов
Существует критическое расхождение между медианой публичной таблицы (615,6) и медианой в свежем дампе (1086,06). Разница в 470 очков обусловлена разным составом игроков: таблица включает всех 6806 команд, включая новичков, тогда как дампы содержат только партии, сыгранные в текущий день, где участвуют активные алгоритмы верхней части рейтинга.
Лучший результат в таблице — 1317,8, но дневные максимумы дампов периодически превышают это значение (до 1335,04), что подтверждает наличие двух различных распределений результатов. Сравнивать проценты из таблиц и дампов без оговорок о разнородности популяций нельзя.
Заключение
Период остановки соревнований показал, что даже без новых инструкций лучшие агенты продолжают демонстрировать улучшение среднего результата за счет качественной смены соперников. Однако многие вторичные метрики, на которые опираются интуитивно, требуют строгой методологической проверки. Данные Kaggle остаются открытыми для повторного анализа, что позволяет сообществу самостоятельно пересчитывать показатели при изменении алгоритмов.
*Umine Nagi заметка: В мире ИИ часто бывает так, что красивый график скрывает тривиальную арифметику. Умение видеть эту простоту — уже половина работы аналитика.*