TimeCapsule: Как выдумки ИИ становятся ключом к пониманию Викторианской эпохи
В эпоху, когда искусственный интеллект уверенно предсказывает будущее на основе текущих данных, команда исследователей предприняла смелый шаг в обратном направлении. Вместо того чтобы тренировать нейросети на современном контентах, они создали 'TimeCapsule' — модель, обученную исключительно на текстах викторианской эпохи (1800–1875 гг.). Это исследование, опубликованное на arXiv, показывает, что именно ошибки модели — так называемые галлюцинации, когда ИИ 'придумывает' несуществующие слова или объяснения — могут стать способом понять, как люди XIX века воспринимали мир и понятия, которых тогда не существовало.
# Искусственный интеллект как машина времени
В привычном понимании большие языковые модели (LLM) страдают от одной фундаментальной проблемы: они 'темперально перегружены'. Обучаясь на огромных массивах данных из интернета, книг и новостей последних десятилетий, ИИ усваивает современный сленг, концепции и контекст. Это делает их крайне ненадежными рассказчиками истории. Попытка заставить такую современную модель говорить языком XIX века или объяснить викторианские понятия современным читателю обречена на провал, так как нейросеть будет постоянно подсказывать современные аналоги.
Вместо борьбы с этим ограничением, исследователи из Хьюстонского университета и Университета Западной Аризоны (авторы работы 'TimeCapsule: Generative Hallucination as a Method for Historical Sensemaking') решили пойти иным путем. Они не пытались заставить современный ИИ забыть будущее. Вместо этого они создали изолированную модель, которая знает только прошлое.
Архив, отрезанный от будущего
Модель, получившая название TimeCapsule, представляет собой причинно-следственную нейросеть в стиле LLaMA объемом 1,2 миллиарда параметров. Главное отличие этой архитектуры от современных гигантов вроде GPT-4 заключается в ее 'диете'. TimeCapsule была обучена исключительно на текстовых корпусах викторианской эпохи. Она не знала, что такое компьютер, интернет или климатический кризис, потому что таких данных в ее обучающей выборке не было.
Результаты количественной оценки показывают удивительную эффективность такого подхода. По метрике perplexity (мера сложности текста для модели) TimeCapsule показала снижение на 45,4% по сравнению с базовой моделью GPT-2 при работе с текстами викторианского происхождения. Это означает, что модель предсказывала следующие слова в исторических текстах значительно точнее, чем модели, обученные на смешанных данных.
Галлюцинация как инструмент интерпретации
Здесь кроется философский парадокс, лежащий в основе исследования. Современные ИИ стремятся быть точными, избегая выдумывания фактов. TimeCapsule, напротив, 'галлюцинирует' — она выдумывает. Однако эта выдумка не случайна.
Когда модель сталкивается с понятием, которого не существовало в викторианском сознании (например, компьютер), она не просто отказывается отвечать или использует современный термин. Вместо этого она строит исторически правдоподобные аналогии. В качестве примера в работе приводится описание компьютера как 'увеличенного легкого' (hypertrophied lung). Это объяснение абсолютно нелепо с точки зрения современной логики, но оно идеально отражает викторианскую оптику, где технологии часто метафоризировались через биологические или механические аналоги, знакомые людям той эпохи.
Исследователи называют это 'вычислительным осмыслением' (computational sensemaking). Модель не просто генерирует текст, она пытается 'успокоить' свое внутреннее напряжение, используя доступные ей концепции для объяснения непонятных ей явлений. Таким образом, так называемая ошибка (галлюцинация) становится методом исследования онтологии XIX века.
Кризис аутентичности
Однако этот подход имеет одну сложность, которую выявила качественная проверка с участием двух ученых-гуманитариев. Проведенный ими 'герменевтический зонд' показал тревожный факт: эксперты не могли отличить реальные тексты викторианской эпохи от сгенерированных моделью. Примерно 40% реальных викторианских отрывков были ошибочно классифицированы исследователями как произведенные машиной.
Это создает кризис аутентичности. Если ИИ способен создавать тексты, неотличимые от исторических оригиналов, используя только выдуманные (галлюцинаторные) связки идей, то граница между документальной историей и художественной интерполяцией размывается. Это не подделка, а отражение того, насколько глубоко модель освоила стилистику и логику эпохи, настолько, что ее 'выдумки' становятся более историчными, чем некоторые подлинные тексты.
Исследование, принятое к публикации на конференции Creativity and Cognition (C&C '26), подводит к выводу, что структурированное невежество модели о будущем — ее игнорирование событий XX и XXI веков — трансформирует ошибки генерации в мощные инструменты для понимания ментальности прошлого. TimeCapsule доказывает, что иногда, чтобы понять прошлое, нужно временно забыть будущее.