RAG · Искусственный интеллект · ИИ · Python · LLM · История · Технологии8 сентября в 04:02 · 4 мин

ИИ-система 'АЙ_Ленин': как RAG и диалектика анализируют новости через призму литературного наследия

Автор статьи NLegion на платформе Habr описывает создание сложной системы на базе искусственного интеллекта, способной анализировать современные новостные сводки, имитируя взгляд Владимира Ленина. Проект опирается не на дообучение моделей, а на технологии RAG (Retrieval-Augmented Generation) и гибридный поиск по архиву «Полного собрания сочинений», дополненный оригинальным механизмом «диалектической оркестрации» для структурирования аргументов.

Обломок морской стекловидной призмы на скале в лунной ночи.

# RAG-система «АЙ_Ленин»: диалектический анализ новостей с позиций исторической личности

Проблема интерпретации новостей требует не просто фактоидов, а глубокого анализа контекста. В мире информационного шума и блогерской риторики возникает естественный вопрос: как бы оценил современный факт человек, оставивший значительный след в истории? Автор проекта NLegion реализовал ответ на этот вопрос в виде технической системы «АЙ_Ленин», использующей литературные источники о Владимире Ильеиче Ленине как базу знаний для генерации аналитических выводов.

От fine-tuning к RAG: почему дообучение здесь не сработало

После первых экспериментов в 2025 году автор столкнулся с закономерной проблемой, знакомой многим разработчикам ИИ: попытка использовать fine-tuning (дообучение) небольшой языковой модели (7B параметров) привела к массовым галлюцинациям. Система начала выдумывать цитаты, искажать исторические факты и выдавать карикатурно упрощенные ответы в духе клише «революция» или «эксплуатация». Такой подход сформировал бы у пользователя негативное отношение к самой исторической фигуре.

Решение пришло в 2026 году с отказом от переобучения в пользу RAG (Retrieval-Augmented Generation). Эта технология позволяет использовать предобученную модель (в данном случае Gigachat3-10b) как генератор, который опирается на внешнюю базу знаний. Вместо того чтобы пытаться «выучить» личность на весу, система извлекает релевантные фрагменты из подготовленного корпуса текстов — «Полного собрания сочинений», философских работ оппонентов и исторических трудов того времени — и предоставляет их модели в контексте вопроса.

Подготовка источников заняла значительное время: тексты прошли очистку от типографского шума, были нарезаны на чанки размером 256–512 токенов с перекрытием в 10% и промаркированы онтологическими тегами. Для поиска использовался гибридный механизм в базе данных Qdrant, объединяющий плотные векторные эмбеддинги и классический поиск по словам BM25. Это позволило обеспечить высокое качество поиска даже в большом корпусе текстов.

Диалектическая оркестрация: R1–R2–R3

Сердце системы — уникальный алгоритм, который автор называет «диалектической оркестрацией». Вместо простого запроса к базе данных, система строит запрос, имитирующий метод диалектики, предложенный Гегелем и развитый Марксом и Лениным (тезис — антитезис — синтез). Оркестратор разбивает поиск на три параллельных направления:

1. R1 (Тезис): Прямая позиция. Система ищет в источниках утверждения, которые могли бы служить центральным аргументом по обсуждаемой теме. Это обязательная опора для любого ответа. 2. R2 (Поддержка): Аргументы согласия. Ищутся источники, на которые опирался Ленин (Маркс, Гегель), которые развивают и укрепляют тезис R1. 3. R3 (Антитезис): Критическая позиция. В этот слот загружаются взгляды оппозиции или критические точки зрения, позволяющие испытать тезис на прочность.

Собранные данные структурируются в специальный промпт, где модель обязана синтезировать итоговый вывод, преодолевая противоречия между позициями. При этом в промпте содержатся жесткие инструкции: не выдумывать цитаты, не использовать термины, появившиеся после 1924 года, и не выдавать себя за очевидца современности.

Системный контроль и митигация ошибок

Работа с ИИ требует надежных механизмов безопасности и качества. Проект включает многоступенчатую систему постобработки («гейты»):

* PreRagCensor (Цензура до генерации): Модуль отсеивает новости по тематическим стоп-словам, экономя ресурсы. Однако автор признает, что такой фильтр на основе списков не идеален и может допускать ошибки. * Анти-клише и Анти-анахронизм: После генерации текст проверяется на наличие современных штампов и аномалий. Если в ответе появляются термины, не существовавшие в эпоху Ленина, или характерные для нашего времени клише, публикация блокируется. * Обработка «мертвой онтологии»: Одним из главных вызовов является ограничение базы знаний текстами начала XX века. Чтобы анализ новостей о современном мире (например, о кризисе или трансферах в футболе) был осмысленным, система определяет тему новости не через поиск точного совпадения фраз, а через анализ смысловых категорий, применимых к историческому контексту.

Результаты и статистика

По данным с производственной среды (VPS) за август 2026 года, система продемонстрировала высокую эффективность фильтрации. Из потока RSS ленты новостей (около 1000–1150 сообщений в день) лишь около 39% проходили через все фильтры и получали полноценный анализ от ИИ. Около 58% сообщений блокировались на этапе предварительной цензуры как не относящиеся к тематике или содержащие триггеры, а ещё часть отправлялась на ручной пересмотр.

Стоимость обработки составила незначительную сумму при использовании внешних API для генерации, что подтверждает гипотезу автора о том, что «малая LLM с качественной программной обвязкой на узкой задаче может показать результат, сопоставимый с большой моделью». Проект открыт на GitHub, а результаты анализов публикуются в мессенджер.

Создание «АЙ_Ленина» — это пример того, как техническая реализация RAG может сочетаться с философскими концепциями для создания нового типа медиа-аналитики, хотя автор честно указывает на остающиеся проблемы: нестабильность API, сложность обновления статичной онтологии и постоянную необходимость подкрутки фильтров безопасности.

Первоисточники

Habr AI
← Вернуться в эфир